AI Infra Summit 2026, organisé du 15 au 17 septembre 2026 au Santa Clara Convention Center, a donné une image nette de la prochaine bataille de l’intelligence artificielle : la course ne porte plus uniquement sur le nombre d’opérations par seconde. Les entreprises présentes ont surtout insisté sur la bande passante mémoire, la consommation électrique, les interconnexions entre machines et le temps nécessaire pour concevoir de nouvelles puces.

Le sommet, organisé par Kisaco Research, était consacré à l’infrastructure de l’IA agentique et des déploiements à grande échelle : processeurs, stockage, centres de données, logiciels, réseaux et IA physique. Le programme s’est déroulé entièrement en présentiel à Santa Clara, en Californie, avec des sessions quotidiennes prévues de 7 h 30 à 16 heures.

Le message central : le calcul brut ne suffit plus

Un modèle d’IA peut être très puissant et rester limité par les éléments qui l’entourent. Les données doivent circuler entre la mémoire et les processeurs, les serveurs doivent échanger rapidement des blocs de calcul et l’alimentation électrique doit être répartie avec précision. Pour les systèmes agentiques, qui enchaînent plusieurs étapes et sollicitent rapidement les modèles, ces contraintes deviennent particulièrement visibles.

C’est le fil rouge qui reliait les annonces de NVIDIA, d-Matrix, Qualcomm, Broadcom, Cognichip et Positron AI. Chaque entreprise abordait un maillon différent de la chaîne, mais toutes parlaient d’un même problème pratique : faire fonctionner davantage d’IA dans des centres de données où la puissance, la mémoire et les connexions ne sont pas infinies.

NVIDIA mise sur Vera et la gestion de l’énergie

NVIDIA a présenté des données consacrées à Vera, son processeur destiné notamment aux charges de travail agentiques. Ces données annonçaient un avantage de 50 à 100 % face à AMD Turin sur les charges examinées. AMD, de son côté, a présenté une conclusion concurrente favorable à ses propres performances face à Vera. Les deux présentations ne reposaient pas sur un protocole de comparaison commun exposé pendant le sommet : il faut donc conserver séparément les résultats revendiqués par chaque entreprise.

NVIDIA a également présenté DSX MaxLPS, un firmware de gestion de l’énergie destiné aux GPU surdimensionnés par rapport à la puissance effectivement disponible. Selon la présentation de NVIDIA, une politique de répartition de l’énergie pourrait permettre jusqu’à 40 % de revenus supplémentaires pour une AI Factory, en réduisant la puissance inutilisée dans le centre de données.

L’enjeu est moins spectaculaire qu’un nouveau record de calcul, mais il est très concret. Un centre de données peut disposer de suffisamment de GPU et pourtant ne pas exploiter toute cette capacité si son alimentation électrique ou son refroidissement impose des limites. La gestion fine de la puissance devient alors une question de rendement économique autant que d’ingénierie.

d-Matrix et Qualcomm placent la mémoire au premier plan

La mémoire est l’autre grand sujet du sommet. Lorsqu’un processeur attend des données, une partie de sa puissance reste inutilisée. Ajouter des unités de calcul ne règle pas automatiquement ce problème : il faut aussi fournir les données à la bonne vitesse.

Raptor : une architecture à DRAM empilée

d-Matrix a présenté Raptor, un accélérateur d’inférence prévu avec de la DRAM empilée. Cette architecture place davantage de mémoire à proximité de la logique de calcul afin de réduire les déplacements de données. d-Matrix revendique pour Raptor dix fois plus de performances avec un dixième de la consommation, ainsi qu’un débit supérieur à 3 000 jetons par seconde sur GLM 5.2 dans les conditions de présentation.

Le graphique associé indiquait environ 3 153 jetons par seconde et par utilisateur avec une taille de lot de huit et un contexte d’un million de jetons. Les valeurs annoncées diminuaient avec des lots de 16 et 32 utilisateurs. Elles décrivent donc une configuration précise, et non un débit valable pour toutes les charges d’inférence.

Raptor appartenait encore à la feuille de route présentée par d-Matrix lors du sommet. L’entreprise a aussi évoqué une génération prévue pour 2028 avec plusieurs couches de DRAM empilée. Dans une autre architecture, d-Matrix et Parasail associaient des GPU NVIDIA H200 pour le traitement du contexte à des accélérateurs d-Matrix Corsair pour la phase de décodage. Cette séparation, appelée inférence désagrégée, répartit les étapes d’une requête entre des composants spécialisés.

Qualcomm rapproche la mémoire de la logique

Qualcomm a présenté High Bandwidth Compute, une architecture qui place de la DRAM empilée sur une puce logique. La présentation annonçait six fois plus de bande passante par watt que la mémoire HBM et 200 fois plus de capacité par watt que la SRAM.

Ces chiffres illustrent deux priorités différentes. La bande passante détermine la vitesse à laquelle les données alimentent le calcul ; la capacité détermine la quantité de données qui peut rester proche du processeur. Pour l’inférence de modèles volumineux, les deux dimensions comptent, notamment lorsque les fenêtres de contexte deviennent très longues.

ESUN veut faire sortir le réseau de la boîte noire

Broadcom a défendu Ethernet Scale-up Networking, ou ESUN, comme une approche ouverte des réseaux scale-up. Un réseau scale-up relie les composants qui participent directement à un même système de calcul, plutôt que de connecter uniquement des serveurs séparés par le réseau classique du centre de données.

La discussion autour d’ESUN était associée à l’Open Compute Project. Broadcom a également mis en avant la série de commutateurs Tomahawk 6, annoncée avec une capacité de commutation de 102,4 Tbit/s et présentée comme un composant produit en volume au début de 2026.

Le réseau visé ne se limite pas aux échanges à l’intérieur d’un seul rack. Une autre initiative, Optical Compute Interconnect, cherche à faire évoluer les interconnexions optiques vers des architectures couvrant plusieurs racks et plusieurs rangées. Le déploiement d’un écosystème ESUN et UALink à grande échelle reste un processus qui s’étale sur plusieurs années : changer les liens entre accélérateurs implique aussi les commutateurs, les logiciels et l’organisation des centres de données.

Cognichip s’attaque au délai de conception des puces

Le goulet d’étranglement ne se situe pas seulement dans les machines déjà installées. Concevoir puis fabriquer une nouvelle puce prend aussi du temps.

Cognichip a présenté des modèles d’IA fondés sur la physique pour automatiser certaines étapes de la conception des puces. Il ne s’agit pas de grands modèles de langage utilisés comme assistants généralistes, mais de modèles spécialisés dans les contraintes propres à l’électronique et à la conception matérielle. Cognichip affirme que son approche pourrait accélérer les cycles de conception jusqu’à 100 fois.

Le sommet a également repris l’ordre de grandeur de cycles traditionnels de 18 à 30 mois pour la conception et la fabrication d’une puce, avec une perspective de 3 à 6 mois pour certains cycles assistés par l’IA. Cette réduction changerait la vitesse à laquelle les fabricants peuvent adapter leurs composants aux nouveaux modèles, aux nouvelles mémoires et aux nouvelles architectures de réseau.

Positron présente Atlas et la feuille de route Titan

Positron AI a déclaré avoir levé 875 millions de dollars pour une valorisation de 5 milliards de dollars. L’entreprise a aussi déclaré déployer plus de 50 racks Atlas dans Oracle Cloud Infrastructure.

Atlas est présenté comme un système d’inférence destiné aux modèles qui nécessitent de grandes capacités de contexte. Positron revendique notamment un avantage de trois fois le rapport performances-prix face à NVIDIA DGX H200 et des fenêtres de contexte de plus d’un million de jetons. Ces chiffres restent des affirmations de l’entreprise et dépendent de la configuration et de la charge comparées.

La feuille de route Titan vise jusqu’à 18,4 To de mémoire par système, jusqu’à 32 000 milliards de paramètres par serveur et des fenêtres de contexte supérieures à 10 millions de jetons. Titan est une cible future présentée par Positron, pas une disponibilité commerciale établie au moment du sommet.

Ce que cela change pour les concepteurs d’infrastructures IA

Le sommet dessine une hiérarchie plus complexe que le simple classement des accélérateurs. Pour une charge d’inférence, il faut désormais examiner au moins cinq éléments : la bande passante mémoire, la capacité disponible, la consommation par unité de calcul, la vitesse des interconnexions et l’intégration logicielle.

Le choix dépendra donc du travail demandé. Un système destiné au décodage de longues réponses n’aura pas les mêmes priorités qu’une plateforme d’entraînement, qu’un service d’agents enchaînant de nombreuses requêtes ou qu’un centre de données cherchant à exploiter au mieux une puissance électrique limitée.

AI Infra Summit 2026 a ainsi déplacé la question : le meilleur matériel n’est plus nécessairement celui qui affiche le plus grand chiffre de calcul isolé, mais celui qui évite que la mémoire, l’énergie ou le réseau ne deviennent le maillon faible de toute l’installation.