Présentation : Déployer des sy... Note
InfoQ RSS

Présentation : Déployer des systèmes RAG multimodaux avec vLLM

Stephen Batifol discute de la construction et de l'optimisation de systèmes RAG multimodaux auto-hébergés. Il décompose la recherche vectorielle, les index de plus proches voisins (FLAT, IVF, HNSW) et le rôle essentiel du choix du bon modèle d'intégration. Il explique ensuite l'optimisation de l'inférence vLLM (attention paginée, quantification) et utilise Pixtral de Mistral pour détailler l'architecture des grands modèles de langage multimodaux. Par Stephen Batifol
CdXz5zHNQW_0ymDaihHg4.jpeg