Google Cloud Blog на русском
Подписаться
Как Box открывает мультимодальных корпоративных агентов с помощью Gemini Embeddings 2
Управление корпоративным контентом претерпевает значительную архитектурную трансформацию, выходя за рамки традиционного текстового ИИ. Компании хранят огромные объемы критически важных данных в Box, включая финансовые модели и юридические документы. Хотя текстовый поиск и RAG были эффективны, новая эпоха агентов требует мультимодальных возможностей. Эта эволюция позволяет системам обрабатывать и понимать не только текст, но и пространственные и структурные данные. Google Cloud и Box интегрируют передовые мультимодальные возможности в платформу Box’s Agentic Platform, основанную на Gemini Multimodal Embeddings 2. Это слияние расширяет платформу Box с помощью векторных представлений ИИ от Google Cloud.Улучшенные векторные представления сохраняют визуальную и пространственную геометрию, критически важную для понимания сложных документов, таких как финансовые таблицы. Они выделяют визуальные элементы, такие как диаграммы и блок-схемы, делая их доступными для поиска наряду с текстом. Эта технология также связывает гибридные форматы файлов, унифицируя понимание между PDF, электронными таблицами и презентациями. Gemini Multimodal Embeddings 2 создает единое векторное пространство для текста, изображений и страниц документов. Это обеспечивает кроссмодальный поиск (текст-изображение и изображение-текст) без ручной маркировки. Система также поддерживает встраивание документов с учетом макета, сохраняя визуальные иерархии и беспрепятственно связывая разнородные форматы.Три основных паттерна для мультимодальных корпоративных агентов возникают в результате этой интеграции в Box. Первый паттерн решает задачи сложной финансовой и аналитической отчетности, захватывая структурное выравнивание таблиц и диаграмм. Это позволяет агентам выполнять визуальный анализ тенденций и контекстное извлечение данных. Второй паттерн фокусируется на мультимодальной поддержке принятия клинических решений, синтезируя различные форматы данных, такие как физические фотографии и гистологические препараты. Это обеспечивает кроссмодальный клинический синтез, гранулярную идентификацию аномалий и поддержку принятия решений с учетом рисков. Третий паттерн решает задачи мультимодального синтеза между документами и сверки данных для фрагментированной корпоративной информации. Это приводит к синтезу между файлами, разрешению конфликтов и аудиту от визуального к текстовому представлению в разрозненных документах.Будущее управления корпоративным контентом на основе агентов зависит от этой интеграции, чтобы выйти за рамки базового поиска и перейти к интеллектуальному сотрудничеству. Платформа Box предоставляет управляемый, семантически индексированный слой рассуждений для агентов ИИ, обеспечивая соответствие требованиям и безопасность. Проактивно предоставляя аналитические данные и выявляя несоответствия, Box помогает снизить бизнес-риски. Это мультимодальное понимание критически важно для таких отраслей, как финансовые услуги и науки о жизни. Box служит управляемой основой контента, гарантируя, что рабочие процессы на основе ИИ используют авторизованные и аудируемые данные. Способность осмыслить присущий мультимодальный ландшафт корпоративных данных знаменует новую эру производительности и инноваций.