Le 24 juin 2026, OpenAI a annonce Jalapeño — une puce d'inference co-concue avec Broadcom, de la conception au tape-out en seulement neuf mois. Une semaine plus tard, le 7 juillet, Reuters citait trois sources indiquant que DeepSeek developpe sa propre puce IA d'inference, lancee environ un an auparavant, toujours en phase initiale. Le meme jour, The Information rapportait que Zhipu AI evalue egalement du silicium personnalise. Pendant ce temps, T-Head d'Alibaba a deja livre plus de 560 000 puces Zhenwu avec un chiffre d'affaires annuel de plusieurs milliards. Ce n'est pas une histoire chinoise ou geopolitique — c'est une histoire d'economie unitaire. Cet article analyse la chaine de preuves DeepSeek, les declarations reelles de Liang Wenfeng, la feuille de route huit ans d'Alibaba T-Head, la vague mondiale de puces personnalisees, cinq facteurs structurels et pourquoi l'inference — pas l'entrainement — est le terrain ou les ASIC personnalises gagnent.
- Conclusion : La puce DeepSeek est credible mais embryonnaire. Alibaba livre deja a grande echelle. OpenAI vient d'annoncer Jalapeño. Le silicium personnalise est devenu un choix d'infrastructure grand public.
- Facteur principal : Economie. L'inference est le cout mensuel permanent de l'IA. Les ASIC personnalises peuvent reduire le TCO de 30 a 65 % par rapport aux GPU a grande echelle.
- Liang Wenfeng n'a pas annonce de programme de puces. Reuters a rapporte des actions d'entreprise (recrutements, contacts avec des fonderies) — pas une declaration du fondateur.
- Alibaba T-Head n'est pas une rumeur. Jack Ma l'a nomme en 2018 ; huit ans plus tard, le Zhenwu 810E est en production serie.
SECTION 01 Ce que Reuters a reellement rapporte (et ce que DeepSeek n'a pas confirme)
| Date | Evenement |
|---|---|
| 2023–2024 | Liang Wenfeng en interview : les controles des exportations sont le plus grand defi ; la soif de compute est permanente |
| Janv. 2025 | DeepSeek R1 lance, choc dans la Silicon Valley ; entraine sur Nvidia H800 (interdit a l'exportation depuis fin 2023) |
| Mi-2025 | Projet de puce aurait demarre discretement |
| Avr. 2026 | DeepSeek V4 adapte pour Huawei Ascend ; V4-Flash partiellement entraine sur Ascend |
| Juin 2026 | Premier tour de financement externe ~7,4 Mds $ ; usage declare inclut puce IA proprietary |
| 7 juil. 2026 | Exclusivite Reuters : DeepSeek developpe une puce d'inference personnalisee, recrute des ingenieurs, contacte des fonderies |
| 7 juil. 2026 | The Information : Zhipu AI evalue egalement une puce personnalisee (meme jour) |
Formulation correcte : « Selon Reuters et d'autres medias, DeepSeek a lance un projet de puce d'inference personnalisee. » Inexact : « Liang Wenfeng a annonce que DeepSeek construirait des puces. » Cette distinction est cruciale pour la credibilite.
SECTION 02 Ce que le PDG Liang Wenfeng a vraiment dit sur les puces et le compute
Liang Wenfeng accorde rarement des interviews. La source la plus autorisee est deux conversations approfondies avec le media chinois Angang Waves en mai 2023 et juillet 2024. Il n'a jamais publiquement annonce un programme de developpement de puces, mais a clairement etabli la justification strategique :
- « Le vrai defi n'est pas l'argent — ce sont les controles des exportations sur les puces haut de gamme. » — Juillet 2024, Angang Waves
- L'ecart de compute de 4x : « Le meilleur niveau de Chine par rapport a l'etranger a environ 1x d'ecart en efficacite d'entrainement et 1x en efficacite des donnees — soit environ 4x le compute necessaire pour le meme resultat. »
- « La Chine doit se tenir a la frontiere. » Enonce sur l'ecosysteme, pas une annonce de produit.
- « La faim de compute est sans fin. » Intention strategique, pas une feuille de route produit.
SECTION 03 Alibaba T-Head livre deja — le pari de Jack Ma de 2018 porte ses fruits en 2026
| Modele | Sortie | Specifications cles et statut |
|---|---|---|
| Hanguang 800 | 2019 | Premiere puce d'inference IA ; etabli la voie commerciale de T-Head |
| Zhenwu 810E | Janv. 2026 | Entrainement + inference ; 96 Go HBM2e ; performances entre Nvidia A800 et H20 ; en production serie |
| Zhenwu M890 | 2026 | 144 Go VRAM ; 800 Go/s puce-a-puce ; ~3x performances 810E |
| Zhenwu V900 | Prevu T3 2027 | 216 Go VRAM ; 1 200 Go/s interconnexion |
| Zhenwu J900 | Prevu T3 2028 | Architecture de calcul parallele proprietary — iteration finale |
- Livraisons : 560 000+ cumulees (S1 2026)
- Chiffre d'affaires : Run annuel en milliards de CNY
- Compatibilite CUDA : Selon le WSJ, les puces Zhenwu sont concues pour etre compatibles avec l'ecosysteme CUDA de Nvidia, reduisant les couts de migration — difference strategique majeure avec l'approche Huawei Ascend
- Fabrication : Passage de TSMC aux fonderies nationales (SMIC) pour contourner les restrictions US
SECTION 04 Ce n'est pas qu'une histoire chinoise : Jalapeño d'OpenAI et la vague mondiale du silicium personnalise
TrendForce 2026 : taux de croissance des livraisons de puces IA personnalisees des hyperscalers 44,6 % contre 16,1 % pour les GPU generaux. Le silicium personnalise depasse pour la premiere fois significativement le marche GPU en termes de croissance.
| Entreprise | Projet de puce | Phase | Donnee cle |
|---|---|---|---|
| DeepSeek | ASIC d'inference personnalise (sans nom) | R&D initiale | 7,4 Mds $ leves ; recrutement prive ; non confirme |
| Alibaba (T-Head) | Zhenwu 810E / M890 | Production serie | 560 000+ livrees ; CA annuel en milliards |
| OpenAI | Jalapeño (avec Broadcom) | Tape-out termine, deploiement fin 2026 | 9 mois conception-tape-out ; cible inference ChatGPT |
| TPU v6 / v7 | Usage commercial a grande echelle | Charges Gemini end-to-end sur TPU | |
| Amazon | Trainium3 / Inferentia | Commercial | Anthropic utilise Trainium massivement |
| Anthropic | Negociations puce personnalisee Samsung | Phase exploratoire | The Information, juillet 2026 |
OpenAI — Annonce officielle de la puce d'inference Jalapeño
SECTION 05 Pourquoi les geants tech construisent des puces IA : cout, controle et la « taxe Nvidia »
En une phrase : la competition IA est passee de « qui a le meilleur modele » a « qui a le compute le moins cher et le plus controlable ».
-
Economie : l'inference est le loyer mensuel permanent de l'IA
Entrainement = apport initial (ponctuel). Inference = loyer mensuel (continu, proportionnel aux utilisateurs). Quand un produit de classe ChatGPT a des centaines de millions de DAU, les depenses d'inference depassent celles d'entrainement. Les ASIC personnalises peuvent atteindre 40 a 65 % d'avantage TCO sur les GPU dans des deploiements d'inference large echelle et long terme, avec 30 a 40 % de reduction du cout par token. La marge brute GPU de Nvidia depasse 70 %. Les puces personnalisees convertissent cette « taxe GPU » permanente en un investissement R&D ponctuel. -
Securite de la chaine d'approvisionnement et geopolitique
Controles des exportations US sur H100/H800/H20. Meme les entreprises americaines font face a des problemes d'allocation GPU. La securite signifie la previsibilite : ne pas dependre d'un seul fournisseur ou d'une seule politique nationale d'exportation. -
Co-conception materiel-logiciel
UE8M0 FP8 et architecture MLA de DeepSeek optimises pour du materiel specifique ; Jalapeño d'OpenAI concu autour des patterns reels de serving ChatGPT (cache KV, batching, latence) ; TPU de Google etroitement couple a TensorFlow/JAX. -
Avantage concurrentiel et pouvoir de negociation
Meme sans remplacer entierement Nvidia, les puces proprietary apportent un levier dans les negociations d'achat, un compute differenciant pour les clients cloud et permettent des recits full-stack. -
Energie et durabilite
Les puces d'inference optimisent la performance par watt. Dans des centres de donnees de l'ordre du megawatt au gigawatt, les couts d'energie et de refroidissement sont aussi importants que les couts d'achat de puces. Les ASIC eliminent la grande partie de la surface de die GPU dediee aux circuits generiques.
SECTION 06 Puces d'inference vs GPU d'entrainement : pourquoi le secteur se divise
| Dimension | Entrainement | Inference |
|---|---|---|
| Nature du workload | Dynamique, experimental, architecture change frequemment | Statique, modele fixe, patterns de requetes previsibles |
| Ecosysteme logiciel | Fosse CUDA profonde (cuDNN, NCCL) | Kernels personnalises possibles pour modeles fixes ; dependance reduite |
| Besoins materiel | Puissance de calcul maximale + haute flexibilite | Debit, latence, optimisation cout par token |
| Echelle economique | Grand investissement cluster unique ; runs limites | 24/7 continu ; lineaire avec le nombre d'utilisateurs du produit |
| Puces representatives | Nvidia H100/B200 (position dominante) | TPU, Trainium, Maia, Jalapeño, Zhenwu, DeepSeek (presume) |
Conclusion : l'entrainement reste le terrain de jeu de Nvidia. L'inference est le champ de bataille ou les ASIC personnalises gagnent. Chaque puce personnalisee annoncee en 2026 — OpenAI, Alibaba, DeepSeek — cible l'inference.
Ce changement d'economie du compute a des implications directes sur le deploiement en production des workloads IA. Les machines virtuelles partagees introduisent une surcharge de planification par hyperviseur qui annule les gains de cout par token du silicium personnalise. Pour les equipes ayant besoin d'un compute natif sans surcharge pour l'inference haute densite, les workflows d'agents IA 24/7, les noeuds physiques Mac Mini M4 dedies MACNOX offrent des performances bare-metal avec acces root et sans virtualisation. Deploiement par jour, semaine ou mois. Voir durcissement de la production d'agents IA et comparaison des couts location vs achat Mac Mini M4, ou visitez la page de tarification.
Sources de reference pour les donnees citees dans cet article (verifier les liens apres publication) :
WSJ — Alibaba AI Chip to Fill Nvidia Void (analyse puce Zhenwu)
Caixin Global — Analysis: Alibaba's New Processor Shows Applications Are Key to AI Chip Success
OpenAI — Annonce officielle puce d'inference Jalapeño
Mis a jour le : 10 juillet 2026. Avertissement : cet article est base sur des reportages medias publics. Le projet de puce DeepSeek n'a pas ete officiellement confirme a la date de redaction. Verifiez les dernieres informations avant de tirer des conclusions.
SECTION 07 FAQ
DeepSeek developpe-t-il vraiment une puce IA ?
Selon le rapport Reuters du 7 juillet 2026 citant trois sources, DeepSeek est en phase initiale de developpement d'une puce d'inference IA personnalisee. DeepSeek n'a pas confirme officiellement. Le tour de financement de 7,4 Mds $ avec usage declare « puce IA proprietary » est la preuve indirecte la plus forte disponible.
Le PDG Liang Wenfeng a-t-il annonce un programme de puces ?
Pas d'annonce publique. Dans des interviews 2024, il a dit que les controles des exportations sont le plus grand defi de DeepSeek. Reuters a rapporte des actions d'entreprise — recrutements, contacts foundries — pas une declaration du fondateur. Cette distinction est importante pour une couverture precise.
Ou en est Alibaba T-Head ?
Le Zhenwu 810E de T-Head est entre en production serie en janvier 2026. A la mi-2026, les livraisons cumulees depassaient 560 000 unites avec un CA annuel de plusieurs milliards de CNY. DeepSeek est approximativement la ou etait Alibaba en 2019.
Pourquoi les puces d'inference d'abord, pas les puces d'entrainement ?
Les workloads d'inference sont repetitifs et previsibles — ideaux pour l'optimisation ASIC. L'entrainement depend encore fortement des GPU Nvidia et de la pile logicielle CUDA. L'inference est aussi le cout permanent 24/7, rendant l'economie du silicium personnalise plus convaincante a grande echelle.
Est-ce pour la securite nationale ou pour economiser de l'argent ?
Les deux, mais l'economie est le facteur principal. Les ASIC personnalises peuvent reduire le TCO de 30 a 65 % par rapport aux GPU a grande echelle. Les controles des exportations et les risques de chaine d'approvisionnement accelerent la transition, mais ne sont pas la seule cause — meme les hyperscalers americains sans de telles contraintes construisent des puces personnalisees.