NVIDIA сообщает, что Groq 3 LPX полностью в производстве для агентного инференса
На Hot Chips NVIDIA назвала Groq 3 LPX ускорителем интерактивного инференса, который расширяет Vera Rubin. На Gemma 4 31B с контекстом 100k Artificial Analysis замерила 3400 выходных токенов в секунду.

24 августа на Hot Chips NVIDIA сообщила, что интерактивный ускоритель инференса Groq 3 LPX, расширяющий Vera Rubin, полностью в производстве. Artificial Analysis замерила Gemma 4 31B при контексте 100k: 3400 выходных токенов в секунду — в четыре раза быстрее ближайшей альтернативы.
Что известно
- Groq 3 LPX описан как ускоритель интерактивного инференса, расширяющий Vera Rubin, и уже полностью в производстве.
- Artificial Analysis зафиксировала 3400 выходных токенов в секунду на Gemma 4 31B с контекстом 100k — вчетверо быстрее ближайшей альтернативы.
- Первое ИИ-облако — Nebius; облако Groq — среди самых ранних пользователей.
- CNBC отдельно писал, что в декабре NVIDIA купила активы Groq за $20 млрд и что в стойке LPX — 256 чипов Groq 3.
Takeaways
- NVIDIA продаёт кремний Groq как серийную надстройку инференса к Vera Rubin, а не как лабораторное демо.
- Главный бенчмарк — скорость декодирования 31B-модели на длинном контексте.
- Покупка активов за $20 млрд в декабре и 256 чипов в стойке — из CNBC, не из заметки NVIDIA.
Source: NVIDIA


