Puce Jalapeño d’OpenAI : les premiers benchmarks face à Nvidia

Puce Jalapeño d’OpenAI : les premiers benchmarks face à Nvidia

  • Actus
  • Rocks on Galaxy
  • Tech
  • 07 Sep, 2026

OpenAI sort enfin du registre « on travaille sur du silicium » : le 25 août 2026, à Hot Chips, l’équipe hardware a présenté Jalapeño, son premier ASIC dédié à l’inférence, co-développé avec Broadcom. Le message n’est plus une roadmap vague, mais des chiffres mesurables — tokens par watt, latence bout-en-bout — face aux systèmes Nvidia GB200 / GB300.

Richard Ho, responsable hardware chez OpenAI, a affirmé devant le benchmark SemiAnalysis InferenceX une avance nette face aux processeurs d’inférence de référence : plus de tokens par utilisateur et plus de débit par kilowatt. La couverture presse (TechCrunch, TechTimes, TechRadar Pro) résume des gains de 1,5 à 1,9× de travail IA par watt au pic de débit, et une latence bout-en-bout 1,7 à 3,6× plus basse sur trois modèles ouverts. Ces chiffres restent fournis par OpenAI / SemiAnalysis : utiles pour cadrer l’ambition, pas encore une validation terrain multi-clients.

Efficacité avant la course aux FLOPS

Jalapeño est noté autour de ~700 W, en dessous des accélérateurs Nvidia de comparaison cités dans les reportages. SemiAnalysis a vérifié une partie des runs dans le labo OpenAI, mais les résultats restent issus de données OpenAI — TechTimes le souligne clairement. L’architecture vise surtout à réduire les allers-retours mémoire : garder le KV cache au plus près pendant l’inférence et limiter le mouvement de données, le vrai goulot des LLM en production.

Ce cadrage change la conversation cloud. Pour un lecteur Rocks, ce n’est pas seulement « qui a le plus gros GPU », c’est le coût d’un token servi, la densité rack et la facture électrique des datacenters qui hébergent ChatGPT et les APIs. Un ASIC pensé pour l’inférence à l’échelle, plutôt qu’un GPU généraliste retargeté, explique pourquoi OpenAI insiste sur les tokens par watt plutôt que sur un score synthétique isolé.

Calendrier : petit volume fin 2026, montée en 2027

Ho a évoqué un déploiement à très petit volume fin 2026, puis une montée plus large en 2027. Autrement dit : jalon de crédibilité silicium aujourd’hui, pas encore un remplacement massif des flottes Nvidia chez les clients OpenAI. Broadcom apporte l’expérience ASIC à l’échelle ; OpenAI apporte la charge réelle d’inférence et les métriques produit. Tant que les volumes restent faibles, Nvidia conserve l’avantage supply chain — mais le récit « OpenAI dépend à 100 % de Nvidia pour longtemps » commence à se fissurer.

Ce qu’il faut retenir

Jalapeño transforme la rivalité OpenAI–Nvidia en histoire d’efficacité mesurée, pas seulement de supply chain GPU. Les gains affichés sont impressionnants, mais restent des résultats constructeur / labo — à suivre dès les premiers déploiements hors démo Hot Chips. Pour les gadgets, abonnements et services cloud derrière l’IA grand public, le signal est clair : l’inférence custom n’est plus du vaporware, et la bataille se joue aussi sur le watt et la latence perçue.

Source : TechCrunch — Hot Chips Jalapeño · TechTimes / SemiAnalysis · TechRadar Pro