Het NVIDIA Vera Rubin rack-systeem met Groq 3 LPX-versnellingsmodule is in volle productie. In benchmarks met het open-source model Gemma 4 31B leverde het systeem 3400 outputtokens per seconde voor contexten van 100.000 tokens, vier keer sneller dan het dichtstbijzijnde alternatief.

De LPX-module breidt het Vera Rubin NVL72-platform uit met snelle tokengeneratie die specifiek is gericht op agentic AI-toepassingen. Dit zijn systemen waarbij AI-modellen niet alleen tekst genereren maar ook acties ondernemen, beslissingen nemen en samenwerken met andere AI-systemen. Dergelijke werklasten vragen om lage latentie en hoge doorvoer in plaats van pure trainingscapaciteit.

CoreWeave heeft Spectrum-X Multiplane in productie genomen om Vera Rubin-racks met elkaar te verbinden. Nebius is de eerste AI-cloud die Groq 3 LPX aanbiedt. NVIDIA presenteerde het systeem op de Hot Chips-conferentie in Palo Alto, waar het bedrijf de filosofie van extreme codesign van rekenkracht, netwerken en inferentie centraal stelde.