Nvidia a annoncé l'entrée en production complète de son rack Groq 3 LPX, issu du rachat pour 20 milliards de dollars d'actifs de Groq en décembre, la plus importante acquisition de son histoire. Le système sera déployé cette année chez le fournisseur de cloud Nebius, aux côtés des processeurs Vera et des GPU Rubin. Nvidia entend répondre à la demande croissante pour l'inférence à faible latence, essentielle notamment aux agents d'intelligence artificielle et aux applications de programmation nécessitant des réponses rapides.
Chaque rack LPX rassemble 256 puces Groq 3, fabriquées par Samsung et intégrant chacune 500 mégaoctets de mémoire SRAM à très haute vitesse. Selon Nvidia, le système peut atteindre 3 400 jetons par seconde, une performance destinée à permettre aux fournisseurs de cloud de proposer des services premium à faible latence. Ces puces spécialisées dans le décodage ne doivent toutefois pas remplacer les GPU, plus polyvalents et capables d'assurer aussi bien l'entraînement que l'inférence des modèles d'IA.
La concurrence s'intensifie sur ce segment, AMD ayant notamment prévu d'intégrer ses systèmes avec les puces de Cerebras, dont la technologie équipe également le mode Ultrafast d'OpenAI, annoncé à 750 jetons par seconde. Nvidia accélère parallèlement le déploiement de ses systèmes Vera Rubin. Jensen Huang prévoit que les ventes cumulées des puces Blackwell et des systèmes Vera Rubin atteindront 1 000 milliards de dollars d'ici 2027 et envisage de réserver aux puces Groq un quart de la capacité de ses centres de données consacrée aux applications de programmation.
0 commentaire
Vous devez être membre pour ajouter un commentaire.
Vous êtes déjà membre ? Connectez-vous
Pas encore membre ? Devenez membre gratuitement
Signaler le commentaire
Fermer