OGLAS

Arhitektura NVIDIA Vera: Kako je prilagođeni Arm CPU dizajniran za eru agentske umjetne inteligencije

·

 U sklopu najave sljedeće generacije platforme Vera Rubin, čije se uvođenje očekuje u drugoj polovici 2026. godine, NVIDIA je objavila tehničku bijelu knjigu (whitepaper) za procesor Vera CPU. Riječ je o prvoj NVIDIA-inoj prilagođenoj procesorskoj arhitekturi temeljenoj na skupu instrukcija Arm, dizajniranoj s primarnim ciljem rješavanja specifičnih uskih grla u radnim opterećenjima agentske umjetne inteligencije (agentic AI). Dok se tradicionalni CPU-i za podatkovne centre fokusiraju na gustoću jezgri i ukupnu propusnost po utičnici (socket), Vera donosi radikalno drukčiju filozofiju dizajna usmjerenu na ekstremne performanse u radu s jednom niti i predvidljivu latenciju.

Četiri ključna stupa za agentsko računalstvo

Agentski AI sustavi često izvršavaju više autonomnih agenata istovremeno, što kritični put obrade prebacuje s GPU-a natrag na CPU. NVIDIA ističe da procesor namijenjen ovakvim opterećenjima mora zadovoljiti četiri ključna uvjeta:

  • Snažne jednonitne performanse (single-thread performance): Održavanje maksimalne brzine obrade po niti čak i pri punom opterećenju svih jezgri unutar utičnice.
  • Visoku propusnost memorije po jezgri: Osiguravanje dovoljnog memorijskog pojasnog širina za paralelno vođenje više aktivnih konteksta izvršavanja.
  • Predvidljivu latenciju: Dosljedan odziv bez nepredviđenih zastoja kako bi se koraci agenata izvršavali sinkronizirano.
  • Učinkovito upravljanje nepravilnim tokom kontrola: Brzo procesiranje čestih lanaca ovisnosti, dinamičkog koda i struktura podataka koje intenzivno koriste pokazivače i indekse.

Arhitektura Olympus: Maksimiziranje IPC-a

Vera se temelji na procesorskoj mikroarhitekturi Olympus, razvijenoj u uskoj ko-dizajn suradnji s cjelokupnom platformom Vera Rubin — uključujući GPU-e, mrežne komponente, sustave za pohranu i softverski stog. Olympus je projektiran od temelja kako bi maksimizirao broj izvršenih instrukcija po ciklusu (IPC) u visoko paralelnim AI okruženjima.

Arhitektura se sastoji od četiri ključna modula

Prednji dio prilagođen kompleksnom softverskom stogu

Vremena izvršavanja agenata (agent runtimes), interpreteri, kompajleri i okviri za obradu grafova troše velike količine instrukcija uz često nepredvidiv tok upravljanja. Prednji dio arhitekture Olympus rješava taj izazov pomoću 10-smjernog dekodera (10-wide decode engine) te naprednog prediktora grananja temeljenog na neuronskoj mreži. Neuronski prediktor značajno smanjuje pogrešne procjene putanje i omogućuje obradu do dvije grane po ciklusu, čime se održava visok protok instrukcija u softverski zahtjevnim okruženjima.

Otkrivanje skrivenog paralelizma u srednjoj jezgri

Srednja jezgra (Mid-Core) fokusirana je na analizu koda i pronalaženje skrivenog paralelizma u zadacima poput interpretacije skripti, upravljanja stanjima i navigacije kroz složene strukture podataka. Koristeći mehanizme za preimenovanje i alokaciju registara te masivni međuspremnik za preuređivanje instrukcija (Reorder Buffer), Olympus ostvaruje duboko izvršavanje izvan redoslijeda (out-of-order execution). Time se smanjuju zastoji uzrokovani radom s memorijskim pokazivačima i dugim serijskim lancima ovisnosti.

Izvršni mehanizam usmjeren na učinkovitost

Dok tradicionalni x86 procesori visoke performanse u jednoj niti uglavnom postižu podizanjem radnog takta, agentski zadaci često su ograničeni memorijskom latencijom i strukturom koda, zbog čega je visoki IPC daleko važniji od same frekvencije. Olympusov izvršni mehanizam dinamički raspoređuje operacije na široki raspon resursa, uključujući cjelobrojne i vektorske jedinice, jedinice za šifriranje te sustave za učitavanje i pohranu.

Podsustav predmemorije s naprednim preddohvaćanjem

Kako bi se spriječili zastoji pri radu s objektima u memoriji koji se ne mogu u potpunosti predmemorirati, Olympus uvodi duboku arhitekturu predmemoriranja s hardverskim mehanizmima za preddohvaćanje podataka (hardware prefetchers). Posebno se ističe mehanizam za preddohvaćanje grafova koji ubrzava pretraživanje velikih skupova rijetkih podataka i baza podataka.

Inovativna prostorna višenitnost (Spatial Multithreading)

NVIDIA sa procesorom Vera ne samo da donosi podršku za višenitni rad u prilagođeni Arm procesor, već uvodi koncept prostorne višenitnosti. Za razliku od klasičnog hipernitanja (Simultaneous Multithreading – SMT), gdje dvije niti konstantno dijele resurse jezgre što može uzrokovati natjecanje za predmemoriju i smanjiti performanse po niti, Vera prilagođava rad stvarnim zahtjevima zadatka.

Kada aplikacija zahtijeva maksimalnu brzinu jedne niti, Olympusova jezgra operira kao izuzetno brz jednonitni procesor. Kada je potrebna visoka gustoća obrade, poput masovnog pozivanja alata ili učenja s potkrepljenjem (reinforcement learning), jezgra se alocira kao dvije neovisne niti bez gubitka stabilnosti odziva.

Koherentna arhitektura i napredni memorijski sustav

Visoki IPC zahtijeva i odgovarajući memorijski podsustav. Vera CPU kombinira Olympus jezgre s NVIDIA Scalable Coherency Fabric (SCF) sabirnicom i SOCAMM2 memorijskim modulima temeljenim na LPDDR5X tehnologiji.

NVIDIA SCF (Scalable Coherency Fabric): Predstavlja internu komunikacijsku mrežu propusnosti do 3,4 TB/s koja povezuje jezgre, dijeljenu L3 predmemoriju od 164 MB, memorijske kontrolere i NVLink-C2C sučelja. Integracija na jednom čipu eliminira latenciju karakterističnu za skokove između više čipleta (chiplets).

SOCAMM2 memorija: Upotrebom LPDDR5X memorijskih modula ostvaruje se ukupna propusnost do 1,2 TB/s (odnosno 14 GB/s po jezgri), uz značajno manju potrošnju energije u usporedbi s DDR5 MRDIMM modulima.

Brz, siguran i skalabilan prijenos podataka

Vera CPU omogućuje fleksibilno skaliranje i visoku razinu sigurnosti unutar AI infrastrukture.

Konfiguracija s dva utora (Dual-Socket)

Pomoću NVLink-C2C tehnologije druge generacije s propusnošću od 1,8 TB/s, dva procesora Vera mogu funkcionirati kao jedinstven sustav. Za razliku od x86 sustava koji često pate od kompleksnih NUMA domena i fragmentacije memorijske topologije, Vera svaki utor definira kao čistu, neovisnu NUMA domenu, čime se softveru pruža predvidljiva skalabilnost.

I/O povezivost i povjerljivo računalstvo (Confidential Computing)

Platforma podržava PCIe 6.4 standard s do 176 linija u sustavima s dva utora, CXL 3.1 za proširenje memorije te Arm CCA/RME tehnologiju za hardversku izolaciju virtualnih strojeva i enkripciju podataka u prijenosu.

Zaključak: Procesor krojen za potrebe modernog AI-ja

NVIDIA Vera redefinira ulogu centralnog procesora u AI podatkovnim centrima. Održavanjem maksimalnih performansi u radu s jednom niti pod punim opterećenjem svih jezgri, Vera osigurava da pokretanje složenih agentskih sustava, analitika podataka i učenje s potkrepljenjem više ne nailaze na uska grla u procesorskoj arhitekturi.

OGLAS