
Cerebras CS-4 brengt AI-inference naar een hoger niveau
Beeld: met AI gemaakt
Chipfabrikant Cerebras introduceert de CS-4, een nieuw AI-systeem dat drie wafer-scale processors combineert in één rack en vooral gericht is op snelle inference. De CS-4 draait op de nieuwe Nexus-architectuur en bevat drie WSE-3 Turbo-processors, geproduceerd door TSMC op een 5nm-proces. Elke chip huisvest vier biljoen transistors en 900.000 AI-cores, met 44 GB SRAM direct op de wafer. Samen leveren de processors 750 PFLOPS aan rekenkracht en 129,6 petabyte per seconde aan geheugenbandbreedte. Door veel verwerking op één wafer uit te voeren, beperkt Cerebras het dataverkeer tussen chips, wat zowel tijd als energie bespaart.
In tests verwerkt de CS-4 bij het gebruik van GPT-OSS-120B meer dan 4.400 tokens per seconde per gebruiker, wat in sommige opstellingen een dertigvoudige versnelling betekent ten opzichte van GPU-oplossingen. De latency tussen wafers daalt van vijf naar minimaal twee microseconden, dankzij Direct Wafer Links, waardoor systemen makkelijker in clusters gecombineerd kunnen worden. De CS-4 ondersteunt modellen met meer dan 50 biljoen parameters en biedt een I/O-bandbreedte van 7,2 terabit per seconde. De eerste systemen worden in het derde kwartaal geleverd; een prijs is nog niet bekend. Cerebras kijkt al naar een opvolger voor 2027, die volgens CEO Andrew Feldman vier keer zo snel en twintig keer meer throughput moet bieden. Meer details staan op de pagina van Techzine.









