llm-d est donné à la CNCF comme projet Sandbox à KubeCon Amsterdam

2026-03-24 · Éditeur : Red Hat · Domaine : Cloud & DevOps

Le 24 mars 2026, à KubeCon Europe, IBM Research, Red Hat et Google Cloud donnent llm-d à la CNCF comme projet Sandbox, dix mois après son lancement : un cadre Kubernetes d'inférence distribuée soutenu par NVIDIA, CoreWeave, AMD, Cisco, Hugging Face, Intel, Lambda et Mistral AI.

Ce qui change

  • Don de llm-d à la CNCF le 24 mars 2026, au niveau Sandbox.
  • Donateurs : Red Hat, IBM Research et Google Cloud ; fondateurs NVIDIA et CoreWeave.
  • Routage sensible au cache KV via Gateway API et LeaderWorkerSet.
  • Métriques Prometheus et Grafana, dont le temps jusqu'au premier jeton.

### Ce qui change Le 24 mars 2026, à KubeCon + CloudNativeCon Europe, **Red Hat, IBM Research et Google Cloud** donnent **llm-d** à la CNCF, au niveau **Sandbox**. Lancé en mai 2025, le projet est un cadre d'inférence distribuée de modèles de langage sur Kubernetes. Les contributeurs fondateurs NVIDIA et CoreWeave, ainsi qu'AMD, Cisco, Hugging Face, Intel, Lambda et Mistral AI, l'accompagnent ; l'université de Californie à Berkeley et l'université de Chicago le soutiennent. ### Caractéristiques - Couche d'orchestration du plan de données entre les plans de contrôle et les moteurs d'inférence, spécialisée pour les LLM. - Un sélecteur de points d'accès (EPP) route les requêtes selon les taux de succès du cache KV et les caractéristiques matérielles. - Intégration native à Kubernetes par Gateway API et par les primitives LeaderWorkerSet. - Export de métriques vers Prometheus et Grafana, dont le temps jusqu'au premier jeton. - Problème visé : l'écart entre l'expérimentation et l'inférence en production, où le routage standard ignore le coût variable des requêtes selon la longueur des jetons et la phase de traitement. ### Pourquoi c'est important L'entrée à la CNCF installe la fondation comme lieu de standardisation de l'inférence, après l'AI Conformance et l'incubation de KServe. Pour une ESN, le signal est double : un schéma d'inférence Kubernetes soutenu par plusieurs éditeurs de puces et de cloud devient plus probable comme référence, et une gouvernance neutre réduit le risque d'enfermement. Sandbox reste le premier niveau : le projet n'a pas encore l'historique de production des projets matures. ### À retenir llm-d entre à la CNCF : l'inférence distribuée des LLM cherche son standard ouvert sur Kubernetes.

Liens

Tags : Kubernetes, IA, Open Source, NVIDIA, Google