Präsentation: Bereitstellung v... Notiz
RSS InfoQ

Präsentation: Bereitstellung von MultiModal RAG-Systemen mit vLLM

Stephen Batifol diskutiert den Aufbau und die Optimierung von selbst gehosteten, multimodalen RAG-Systemen. Er erläutert Vektorsuche, Nearest-Neighbor-Indizes (FLAT, IVF, HNSW) und die entscheidende Rolle der Auswahl des richtigen Embedding-Modells. Anschließend erklärt er die vLLM-Inferenzoptimierung (Paged Attention, Quantisierung) und verwendet Mistrals Pixtral, um die Architektur multimodaler großer Sprachmodelle im Detail zu beschreiben. Von Stephen Batifol
CdXz5zHNQW_0ymDaihHg4.jpeg