Red Hat lance llm-d, une pile Kubernetes pour l'inférence distribuée des LLM

2025-05-20 · Éditeur : Red Hat · Domaine : Cloud & DevOps

Le 20 mai 2025, au Red Hat Summit, Red Hat lance llm-d avec CoreWeave, Google Cloud, IBM Research et NVIDIA : un projet open source d'inférence distribuée sur Kubernetes, fondé sur vLLM, avec cache KV et routage tenant compte de l'IA.

Ce qui change

  • Annoncé le 20 mai 2025 au Red Hat Summit de Boston.
  • Fondateurs : CoreWeave, Google Cloud, IBM Research et NVIDIA, avec Red Hat.
  • Séparation prefill/décodage, déchargement du cache KV et routage tenant compte du cache.
  • Fondé sur vLLM et Kubernetes ; pensé pour plusieurs types d'accélérateurs.

### Ce qui change Le 20 mai 2025, au Red Hat Summit de Boston, Red Hat lance la communauté **llm-d**, un projet open source d'inférence distribuée de modèles de langage à grande échelle sur Kubernetes. Les contributeurs fondateurs sont CoreWeave, Google Cloud, IBM Research et NVIDIA ; AMD, Cisco, Hugging Face, Intel, Lambda et Mistral AI sont partenaires, avec le soutien de l'université de Californie à Berkeley (Sky Computing Lab) et de l'université de Chicago (LMCache Lab). ### Caractéristiques - **vLLM** comme serveur d'inférence open source, compatible avec de nombreux accélérateurs, dont les TPU de Google Cloud. - Séparation des phases de remplissage (prefill) et de décodage sur des serveurs distincts, pour mieux répartir la charge. - Déchargement du cache KV (clés-valeurs) du GPU vers la mémoire du processeur ou un stockage réseau, via LMCache. - Routage réseau « conscient de l'IA » : les requêtes vont vers les serveurs qui détiennent déjà le cache d'inférence pertinent. - Interfaces de communication haute performance, avec prise en charge de la bibliothèque NIXL de NVIDIA ; ordonnancement sur des clusters Kubernetes. ### Pourquoi c'est important Les charges d'inférence ne se comportent pas comme des services web classiques : le coût d'une requête dépend de la longueur des jetons et de la phase de traitement, ce qui met en défaut l'équilibrage de charge standard. llm-d propose une couche commune, indépendante du fournisseur de cloud, pour y répondre. Pour une ESN, c'est un point de repère d'architecture pour les plateformes d'IA internes, à évaluer face aux services managés des hyperscalers. Pour Brian Stevens (Red Hat), llm-d ouvre la voie à une inférence distribuée et performante sur le cloud hybride. ### À retenir llm-d propose un schéma Kubernetes commun pour servir les LLM à grande échelle, soutenu par cinq acteurs majeurs dès le lancement.

Liens

Tags : Kubernetes, IA, Open Source, NVIDIA, Google