OGLAS

Zašto je AMD kupio Taalas: Analiza strategije “traktora” naspram Nvidijinog “Ferrarija” u svijetu AI čipova

·

Kreiranje namjenskog čipa prilagođenog isključivo jednom AI modelu u vremenu kada se arhitektura umjetne inteligencije mijenja iz mjeseca u mjesec na prvi pogled djeluje nelogično. Unatoč tome, AMD je službeno objavio akviziciju kanadskog startupa za razvoj AI čipova Taalas. Po završetku transakcije AMD planira integrirati tehnologiju Taalasa u svoj razvojni plan akceleratora i razvijati rješenja na razini sustava zajedno sa svojim flagship GPU serijama Instinct.

Stručnjaci iz industrije AI čipova ponudili su slikovitu analogiju za ovaj poslovni potez. Dok je Nvidijina strategija uvođenja rješenja poput Groq LPU-a usporediva s dodavanjem ekskluzivnog sportskog automobila postojećoj ponudi radi postizanja apsolutno najviših performansi, AMD-ovo preuzimanje Taalasa više nalikuje kupnji namjenskog traktora. Takvo vozilo nema univerzalnu primjenu, ali je u svom specifičnom domenu iznimno učinkovito.

Pitanje je zašto bi Taalas dobrovoljno žrtvovao fleksibilnost. Prema riječima osnivača Taalasa, dvije glavne prepreke koje sprječavaju potpunu pristupačnost umjetne inteligencije jesu previsok trošak inferencije te nedovoljna brzina odaziva sustava. Općenamjenski GPU-ovi teže visokim performansama, no njihova sposobnost izvođenja bilo kojeg modela zahtijeva iznimno složenu memorijsku arhitekturu, kompleksne veze i opsežan softverski sloj. Taalas je stoga otišao u drugu krajnost kreirajući čipove dizajnirane oko jednog konkretnog modela, ugrađujući težine i tokove podataka izravno u sam hardver. Žrtvovanje svestranosti donijelo je značajno pojednostavljenje hardvera, pri čemu je njihov prvi čip HC1 prilagođen modelu Llama 3.1 8B postigao impresivnu brzinu od približno 17.000 tokena u sekundi po pojedinačnom korisniku.

Stabilnost modela kao preduvjet opravdanosti hardvera

Što se čip više specijalizira za određeni model, to je njegova upotrebljivost izravnije vezana uz životni vijek tog konkretnog modela. Za Taalas nije bilo dovoljno samo dokazati ubrzanje, već je odabrani model morao imati dostatno velik i kontinuiran volumen poziva kako bi se opravdali troškovi prilagodbe hardvera.

Potražnja za vodećim modelima već sada dostiže ogromne razmjere, što potvrđuju podaci da pojedini AI modeli obrade više bilijuna tokena u svega nekoliko tjedana od lansiranja. Ipak, glavno pitanje ostaje koliko će se tih zadataka moći izvoditi na hardverski fiksiranom čipu ako se same verzije modela nastave ubrzano mijenjati.

Industrijski analitičari ističu da je prilikom rasprave o brzini iteracije modela potrebno razlikovati promjene u temeljnoj arhitekturi od promjena u parametrima ili nadogradnjama specifičnih mogućnosti. Za modele koji su već integrirani u konkretne poslovne procese, zamjena najnovijom verzijom nije uvijek neophodna. Zahtjevni matematički i znanstveni zadaci traže najmoćnije dostupne modele, no automatizirane usluge poput rezervacija, podrške ili narudžbi ne zahtijevaju najvišu razinu opće inteligencije. U takvim scenarijima visoki troškovi i spora inferencija predstavljaju znatno veći problem od nedostatka najnovijih mogućnosti.

Osim toga, vezanje hardvera uz jedan model ne ograničava uređaj na samo jedan zadatak jer moderni jezični modeli posjeduju snažne mogućnosti generalizacije. Iako se gubi fleksibilnost prebacivanja na potpuno drugi model, opseg primjene unutar istog modela ostaje iznimno širok. Sam Taalas odabrao je manji model Llama 3.1 8B za svoju prvu generaciju čipova, ali naglašava da su njihovi budući planovi usmjereni prema srednjim i najnaprednijim modelima za kompleksno zaključivanje.

Tehnološka prilagodba i sistemski izazovi skaliranja

Za rješavanje problema promjena u modelima Taalas je pripremio dva različita inženjerska pristupa. Za manje prilagodbe koje ne zadiru u osnovnu arhitekturu, čip HC1 ne zahtijeva ponovnu izradu. Iako su glavne težine fiksirane na čipu, ostavljen je programabilni SRAM prostor za pohranu KV predmemorije i manjeg broja parametara prilikom finog podešavanja putem tehnologije LoRA (Low-Rank Adaptation).

Ako promjene obuhvaćaju sam temeljni model, potreban je novi proces izrade (tape-out), no nije potrebno projektirati čip od nule. Koristeći koncept strukturiranih ASIC-ova, veći dio hardvera ostaje nepromijenjen, dok se prilagodbe usmjeravaju na svega nekoliko završnih proizvodnih slojeva. Težine modela pretvaraju se u trajne metalne veze na čipu umjesto klasičnog zapisivanja u memoriju, čime se ciklus prilagodbe novom modelu može skratiti na svega dva mjeseca. Slična istraživanja hardverski fiksiranih jedinica za obradu jezika razvijaju se i u drugim istraživačkim centrima širom svijeta.

Pravi inženjerski izazov predstavlja dimenzioniranje čipova za masivne modele. Prva generacija HC1 već se površinom približila fizičkim granicama silicijskog čipa, dok bi naredna generacija HC2 trebala proširiti kapacitet na veće modele uz korištenje nižih formata preciznosti i izmještanje dijela memorije. Kada se modeli prošire na stotine milijardi parametara, jedan čip više nije dovoljan te je nužno povezivanje više čipova u jedinstveni sustav.

U sustavima s više čipova ključno je pravilno raspodijeliti računalne zadatke. Umjesto neprekidnog prijenosa cjelokupnih težina modela kroz mrežu, među čipovima se prenose samo međurezultati izračuna, što značajno smanjuje komunikacijski pritisak u usporedbi s tradicionalnim GPU klasterima. Ipak, pojavljuju se drugi sistemski izazovi, poput upravljanja neaktivnim čipovima pri manjem opterećenju, pouzdanosti cjelokupnog niza te opterećenja SRAM memorije.

Upravo u tom dijelu leži razlog AMD-ove akvizicije. Za mladi startup najveća prepreka nije samo izrada prototipa, već pretvaranje ekstremno specijaliziranog hardvera u komercijalno skalabilan proizvod. Kako Taalas prelazi s pojedinačnih čipova na kompleksne višekorisničke sustave, AMD-ovi inženjerski resursi, lanac opskrbe i iskustvo u integraciji sustava postaju presudni.

Ova akvizicija gura specijalizaciju AI hardvera u krajnost. Dok Nvidijina ulaganja u LPU tehnologiju ciljaju na beskompromisne performanse po višoj cijeni, AMD-ovo preuzimanje Taalasa usmjereno je na visoku učinkovitost i nisku cijenu izvođenja u točno definiranim okvirima. Uspjeh ove strategije ovisit će o tome hoće li tržište umjetne inteligencije stvoriti dovoljno stabilne modele i masovne primjene koje opravdavaju ulaganje u visoko specijalizirani hardver.

OGLAS