Aufbau eines RAG-Chat-Assistenten auf Amazon EKS im Auto-Modus und mit NVIDIA NIMs
In diesem Beitrag demonstrieren wir die Implementierung eines praktischen RAG-Chat-Assistenten mithilfe eines umfassenden Stacks moderner Technologien. Die Lösung verwendet NVIDIA NIMs sowohl für die Inferenz von LLM als auch für Dienstleistungen zur Text- Einbettung, wobei der NIM-Operator die Bereitstellung und Verwaltung dieser übernimmt. Die Architektur integriert den Amazon OpenSearch Serverless, um hochdimensionale Vektoreinbettungen für die Ähnlichkeitssuche zu speichern und abzufragen.