VentureBeat на русском Заметка

VentureBeat на русском

VentureBeat - это авторитетный информационный и аналитический сайт, посвященный инновациям и быстро меняющемуся миру технологий, науки и будущего работы. Сайт предоставляет точные репортажи, глубокий анализ рынка и проницательные комментарии о возможностях и проблемах в области развивающихся технологий. На сайте представлен широкий спектр тем, включая искусственный интеллект, робототехнику, блокчейн, игры и многое другое. На сайте публикуются свежие новости, тематические статьи и материалы от гостей, что позволяет читателям получать разнообразный контент.

Трэд заметок

Meta выпустила Muse Spark 1.3, новую модель ИИ, отличающуюся улучшенной скоростью и производительностью по сравнению с предшественником. Генеральный директор Марк Цукерберг подчеркнул, что эта версия является самым значительным достижением Meta в области кодирования и агентских задач. Развертываемая версия, будучи весьма способной, не лидирует в независимых бенчмарках, но предлагает хорошее соотношение цены и производительности. Более мощная конфигурация "max reasoning" проходит тестирование безопасности и будет выпущена позже. Текущая версия Muse Spark 1.3 использует ранее установленные настройки рассуждений, поэтому ключевыми факторами являются реальная стоимость и производительность для предприятий. В материалах Meta, посвященных запуску, особое внимание уделяется варианту "max", который показал более высокие результаты в оценках. Однако поставляемая версия "xhigh" конкурентоспособна, занимая равные позиции с другими ведущими моделями по некоторым показателям интеллекта. Muse Spark 1.3 представляет собой существенное улучшение, чередуя победы с лучшими моделями в оценках кодирования и агентских задач. Модель также обладает улучшенными операционными возможностями, используя меньше вызовов инструментов и токенов для задач кодирования. Несмотря на заявление "слишком дешево, чтобы считать", цены API для Muse Spark 1.3 не снизились. Независимый анализ показывает, что стоимость одной задачи увеличилась, несмотря на неизменные тарифы за токены, из-за более высокого потребления входных токенов. Meta также сохраняет низкостоимостный уровень "Contributor" для использования данных обучения. Выпуск позиционирует Muse Spark 1.3 как конкурентоспособный по сравнению с Gemini 3.8 Flash от Google, при этом Meta демонстрирует небольшое преимущество в интеллекте и стоимости задач. Однако Google лидирует по пропускной способности и предлагает более низкую вводную цену API. Меняющаяся позиция компании в отношении моделей с открытым весом, с неопределенностью относительно выпуска версий Spark с открытым весом, может стать важным фактором для разработчиков. Muse Spark 1.3 демонстрирует быструю итерацию проприетарных моделей Meta, но четкая, развертываемая дорожная карта для ее лучших возможностей и выпусков с открытым весом остается ожидаемой.
CdXz5zHNQW_77CxoerDdo.png
Традиционные маркетинговые метрики, такие как рейтинги и коэффициенты кликабельности, устаревают из-за роста поисковых запросов без кликов и ответов, генерируемых ИИ. Новая задача для маркетологов — обеспечить, чтобы их бренд был неотъемлемой частью этих ответов ИИ. Видимость теперь выходит за рамки позиций в результатах поиска и распространяется на то, насколько заметно бренд появляется в самом ответе, сгенерированном ИИ, подобно "глубине пикселя". Системы ИИ работают иначе, чем традиционные поисковые системы: они извлекают и комбинируют факты из множества источников, а не индексируют целые страницы. Это смещает акцент на ясность, достоверность и последовательность отдельных фрагментов информации.Оптимизация под поисковые системы ответов (AEO) — это, по сути, проблема информационной архитектуры, требующая структурированного контента, последовательной терминологии и четких метаданных. Системы ИИ отдают предпочтение источникам, которые легко интерпретировать, поэтому фрагментированная или непоследовательная информация является недостатком. Читаемость для машин теперь имеет решающее значение для обнаруживаемости, при этом четкие заголовки, краткие абзацы и логичная структура приносят пользу как ИИ, так и людям. Оригинальность, такая как уникальные исследования и данные клиентов, дает значительное конкурентное преимущество, поскольку ИИ не может легко ее воспроизвести. Руководители маркетинговых отделов должны оценить, является ли их экспертиза четко объяснимой, последовательно представленной, организованной для цитирования и действительно оригинальной. В конечном итоге бренды получат видимость, сделав свои знания понятными, проверяемыми и заслуживающими доверия как для ИИ, так и для людей.
Microsoft выпустила MAI-Transcribe-2, новую модель распознавания речи, которая быстрее, точнее и значительно дешевле существующих предложений от конкурентов, таких как OpenAI и Google. Эта передовая модель, стоимостью всего десять центов за час аудио, представляет собой существенное снижение затрат по сравнению с ее предшественником. Стратегия компании включает разработку собственных высококачественных ИИ-моделей, предназначенных для замены тех, которые ранее лицензировались у OpenAI. MAI-Transcribe-2 поддерживает 60 языков и разработана с учетом сложностей реального бизнес-аудио, включая фоновый шум и перекрывающуюся речь. Ключевые функции, такие как диаризация говорящих, временные метки на уровне слов и смещение по ключевым словам, включены без дополнительной платы. Модель также предлагает настраиваемые стили вывода и обрабатывает переключение между языками в рамках одного разговора. Microsoft заявляет о лидирующих позициях в таких бенчмарках, как FLEURS и Artificial Analysis, подчеркивая свою производительность по точности и скорости. Быстрый выпуск трех моделей за пять месяцев демонстрирует ускоренную разработку Microsoft в этой области. Это стремление к созданию собственных ИИ-возможностей обусловлено желанием независимости и улучшением нормы прибыли. Транскрибируя аудио с меньшими затратами, Microsoft может более доступно интегрировать эти функции в свои собственные продукты, такие как Teams, Word и Excel. Этот шаг позволяет Microsoft более эффективно конкурировать на рынке ИИ, снижая зависимость от внешних партнеров. Компания напрямую бросает вызов специализированным поставщикам услуг транскрипции, предлагая основные функции по беспрецедентной цене. Хотя Alibaba отмечается как сильный конкурент, Microsoft стремится предложить убедительную альтернативу для предприятий.
Google выпустила две новые версии своей модели Flash: 3.8 Flash и Flash Cyber. Стандартная модель 3.8 Flash превосходно справляется с агентскими задачами, разработкой программного обеспечения и многошаговыми рассуждениями. Flash Cyber специально оптимизирована для обнаружения и устранения уязвимостей в области кибербезопасности. Генеральный директор Сундар Пичаи отметил значительные улучшения в 3.8 Flash по сравнению с предшественником, превосходя более крупные модели по показателям кодирования при меньших затратах. Flash Cyber демонстрирует передовую производительность в выявлении и устранении уязвимостей в больших масштабах. Это третий релиз Flash от Google за шесть недель, последовавший вскоре за версией 3.7. 3.8 Flash теперь доступна в Gemini Enterprise и через различные инструменты для разработчиков по той же цене, что и 3.7 Flash. Пользователи могут регулировать усилия модели для достижения оптимального качества, стоимости и задержки, при этом 3.8 Flash работает "усерднее" над сложными задачами. Модель имеет окно ввода объемом 1 миллион токенов, может обрабатывать различные типы данных и продемонстрировала впечатляющую производительность на специализированных тестах знаний. Flash Cyber внедряется для избранных партнеров в рамках программы Google Fairwind для расширенных возможностей киберзащиты. Google уже использует Flash Cyber внутри компании для защиты собственного кода, достигая превосходного качества генерации исправлений для уязвимостей Chrome. Способность модели обнаруживать давно существующие уязвимости и предлагать исправления дает значительные преимущества защитникам в условиях растущего числа эксплойтов, управляемых ИИ.
CdXz5zHNQW_O8uOJCHDf7.png
Meta запустила Muse Voice Transcribe, новую модель преобразования речи в текст в реальном времени, объединяющую транскрипцию, определение конца речи и диаризацию говорящих для более чем 20 участников. Разработанная Meta Superintelligence Labs, Muse обрабатывает речь по мере ее поступления и поддерживает длинное аудио, многоязычное переключение кодов и языковое смещение. Хотя возможность работы с более чем 20 говорящими не является мировым рекордом, она уверенно конкурирует, сочетая высокопроизводительную диаризацию с низколатентной транскрипцией и агрессивным ценообразованием. Модель была обучена на более чем 70 языках, 25 из которых были проверены для первоначального выпуска. Диаризация, которая определяет, кто говорил, имеет решающее значение для точных последующих систем ИИ и непосредственно встроена в архитектуру Muse. Muse доступен через публичный API по цене 0,18 доллара США в час, что делает его конкурентоспособным, особенно учитывая, что диаризация включена. Тесты Meta показывают, что Muse лидирует по частоте ошибок в словах и демонстрирует более низкую частоту ошибок диаризации, чем некоторые конкуренты. Несмотря на отсутствие временных меток на уровне слов или оценок уверенности, Muse предлагает разработчикам корпоративного уровня выгодное соотношение цены и производительности. Этот запуск вынуждает конкурентов сосредоточиться на точности с учетом говорящего и общей стоимости, а не только на сыром распознавании речи.
CdXz5zHNQW_q5QrxQkRrB.png
Корпоративные покупатели все чаще рассматривают не-Nvidia AI-ускорители, причем около 40% вероятно будут оценивать альтернативы, такие как AWS Trainium или Google TPU, в течение следующего года, по сравнению примерно с 25% для следующего поколения Nvidia Blackwell. В то время как Nvidia остается доминирующей в производстве, организации создают стратегические опции и оптимизируют существующую инфраструктуру. Срочность смены AI-платформ снизилась, поскольку компании сосредоточены на улучшении текущих операций. Microsoft Azure продемонстрировал значительный рост в производственном внедрении, за ним следуют Google Gemini и OpenAI. Предприятия более эффективно используют собственные GPU, с меньшим количеством работающих на половинной мощности или ниже. Надежность и время безотказной работы теперь являются ведущими показателями эффективности инфраструктуры, а простота внедрения также улучшается. Отход от немедленных изменений платформы обусловлен стремлением к производительности и экономической эффективности на токен, а не к общей совокупной стоимости владения. Интерес к альтернативам Nvidia особенно силен среди лиц, принимающих решения, и в компаниях среднего размера. Предприятия также отдают приоритет контролю над своим AI "упряжью" – слоем, соединяющим модели с корпоративными данными и инструментами. Это указывает на предпочтение сохранения архитектурного контроля вне рамок поставщиков отдельных моделей. Neoclouds, специализированные поставщики AI-облаков, набирают обороты как надежная часть стратегий с несколькими поставщиками, с сообщениями о значительном объеме заказов. Использование открытой AI-инфраструктуры растет, особенно в производственных стеках, что предполагает более глубокое внедрение в определенном сегменте рынка. Эта общая тенденция показывает, что предприятия запускают больше AI-инфраструктуры, активно сохраняя несколько стратегических опций.
Инфокстилеры повторно воспроизводят украденные сессионные куки Claude в платных аккаунтах, обходя двухфакторную аутентификацию страниц входа и единый вход. Anthropic отметил эти аккаунты как самообслуживаемые и оплачиваемые картами, не регулируемые поставщиками корпоративной идентичности. Компания уведомила затронутых пользователей, назвала шесть семей воровщиков, вышла из скомпрометированных аккаунтов и вернула деньги. Основной риск заключается в раскрытии данных, а не только в незначительных финансовых потерях от использования. Часто используемые инфокражалы, такие как Vidar и LummaC2, были выявлены виновниками. Сессионный cookie доказывает, что пользователь уже вошёл, позволяя злоумышленникам выдать себя за легитимных пользователей. Anthropic обнаружил кражу, наблюдая необычные модели использования и опустошённые лимиты. Источники заражения включают пиратские загрузки программного обеспечения и поддельные страницы Claude. Повторная сессия наследует права легитимного пользователя. Это может предоставить злоумышленникам доступ к истории переписок, загруженным файлам и подключённым сервисам, таким как Google Workspace. Сотрудники предприятий, использующие персональные подписки на ИИ на рабочих машинах, являются серьёзной уязвимостью. Многие корпоративные диалоги с ИИ ведутся через личные личности, а не корпоративные. Руководителям безопасности рекомендуется добавить аккаунты ИИ в свои методы реагирования на инциденты. Также появились фишинговые атаки, имитирующие уведомления Anthropic. Рекомендуется учитывать подписки на персональный ИИ на управляемых устройствах и ограничивать гранты OAuth. Перевод интенсивных пользователей на управляемые арендаторы и внедрение привязки сессий — ключевые шаги.
CdXz5zHNQW_XD7BB0LMqj.png
Инженеры с передовым развертыванием играют ключевую роль в стратегиях корпоративного ИИ выхода на рынок, обещая скорость и преимущество в продукте. Однако их истинная ценность заключается в том, приводит ли их работа к наращиванию продукта или просто накапливается в качестве рабочей силы доставки, что часто замыкается. В лучшем случае FDE действует как дисциплинированная функция обучения продукта, превращая крайние случаи в повторно используемые возможности. Напротив, в самых слабых случаях она маскирует ограничения продукта, выполняя ручные переводы. Основная ценность FDE — создание автоматизации, которая обеспечивает работу системы интеллекта, фиксируя корпоративный контекст и изучая их на основе развертываний. Это контекстное понимание, а не просто выбор модели, часто является ограничением корпоративных рабочих процессов. Обучение на основе FDE должно быть закреплено в повторно используемых артефактах, таких как семантические отображения или модули политики. Критически важным является то, работает ли FDE в песочнице для улучшения общего движка или вручную строит кастомные решения в «грязи». Уроки из взаимодействия FDE должны привести к развертываниям, которые начинаются с меньшего количества неизвестных и со временем требуют меньше пользовательского кода. В конечном итоге успешная организация FDE сталкивается с сокращением человеческого перевода на единицу доставленной ценности, а инженеры тратят больше времени на расширение повторно используемых возможностей.
Большие языковые модели (LLM) часто генерируют фактически неверную информацию. Разработчики традиционно решают эту проблему, предполагая недостаток знаний и увеличивая размер модели или объем данных. Однако новые исследования показывают, что LLM часто обладают фактами, но не могут вспомнить их во время генерации. Передовые модели кодируют высокий процент фактов, что указывает на то, что проблема заключается в извлечении информации.Исследование предлагает "профилирование знаний" для различения между закодированными и известными фактами. Кодирование означает, что модель может воспроизвести факт при определенных условиях, в то время как знание означает, что она может надежно отвечать на вопросы о нем в различных формулировках. Сбои кодирования требуют вмешательства на этапе предварительного обучения, в то время как сбои извлечения информации выигрывают от методов пост-обучения.Факт может быть напрямую извлечен, не пройти кодирование, испытать сбой извлечения, быть извлеченным с размышлением или быть выведенным без кодирования. Эксперименты на многочисленных LLM показывают, что передовые модели кодируют большинство фактов, но испытывают трудности с прямым извлечением. Размышления во время вывода, такие как "цепочка рассуждений", значительно помогают извлечению, подобно тому, как человек вспоминает информацию.Масштабирование моделей не решает проблемы извлечения информации и может даже усугубить их, увеличивая количество недоступных закодированных фактов. Извлечение информации сильно зависит от формулировки запроса и контекста, причем редкие или обратные факты представляют большую сложность для извлечения. Разработчики должны избегать рассмотрения всех фактических ошибок как проблем извлечения и вместо этого сосредоточиться на улучшении извлечения.Выборочное использование рассуждений во время вывода и конвейеров "генерация-проверка" может повысить фактическую точность. Тестирование семантического доступа за пределами стандартных метрик точности выявляет истинные знания модели. Переформулировка запросов и повторные попытки также эффективны. Хотя эталон WikiProfile фокусируется на энциклопедических фактах, его методология может быть применена к данным конкретной предметной области, хотя кодирование может быть более значимой проблемой в специализированных областях. Это исследование смещает акцент на оптимизацию пост-обучения и времени вывода, делая улучшенную фактическую точность ИИ более доступной.
CdXz5zHNQW_dscHgi3Puz.jpeg
Эджизиаго Чоффи, ИТ-архитектор, обнаружил критическую уязвимость в безопасности ИИ-агента, которого он создал с использованием Azure OpenAI. Агент успешно прошел все свои оценки, продемонстрировав фактическую точность и выполнение задач. Однако при тестировании с учетной записью с низкими привилегиями агент получил доступ к информации, к которой пользователь не должен был иметь доступа. Это показало, что агент работал с более широкими разрешениями задания индексирования, а не с правами запрашивающего пользователя.Этот тип сбоя, когда агенты используют разрешения индексатора вместо разрешений пользователя, не является единичным случаем. Хотя Azure AI Search внедрил нативную обрезку контроля доступа на уровне документов (ACL), она не реализована повсеместно или не полностью функциональна на всех путях развертывания. Пользовательские конвейеры, подобные конвейеру Чоффи, часто обходят эти нативные функции безопасности. Кроме того, независимые исследования показывают, что значительный процент успешных атак на продуктивные агенты приводит к скрытой эксфильтрации данных, что подчеркивает более широкий класс уязвимостей безопасности.Эти пробелы в безопасности часто упускаются из виду при стандартных оценках, которые фокусируются на качестве ответов, а не на разрешениях, используемых для извлечения данных. Нативная обрезка ACL Azure AI Search, при правильной настройке с использованием принципалов на основе Entra и индексаторов SharePoint, может обеспечивать соблюдение этих границ, но пользовательский конвейер Чоффи обошел это. Основная проблема заключается в нарушении контроля доступа, когда границы авторизации сводятся к самому низкому уровню привилегий с возможностями поиска.Чоффи реализовал исправление, интегрировав фильтр пути запроса, который проверяет разрешения пользователя SharePoint перед отправкой данных в модель. Это гарантировало, что контент, к которому пользователь не может получить прямой доступ в SharePoint, не будет включен в контекстное окно агента. Хотя это сузило объем доступного контента, помощник продолжал автоматически обрабатывать около 60% входящих электронных писем. Компромиссом за повышенную безопасность является потенциально сниженная способность отвечать на вопросы, если необходимый контент заблокирован фильтрами разрешений.Платформы управления идентификацией, которые управляют жизненным циклом учетных записей служб и учетными данными, работают на другом уровне, чем границы разрешений на извлечение. Оба уровня контроля необходимы для комплексной безопасности ИИ-агентов. Простой тест с использованием двух учетных записей, одна с высокими привилегиями и одна с низкими, может выявить проблемы с соблюдением границ разрешений на извлечение в течение тридцати минут. Этот тест, сравнивающий результаты с прямым доступом к системе, показывает, возвращает ли помощник некорректно данные, выходящие за рамки предоставленных пользователю разрешений.
CdXz5zHNQW_IvQGdWYBCM.png
Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1, свои самые передовые языковые модели на сегодняшний день. Fable 5.1 — стандартная версия, а Mythos 5.1 предлагает расширенные возможности для проверенных организаций в области кибербезопасности и наук о жизни. Этот выпуск также направлен на улучшение экономической эффективности корпоративных агентов за счет снижения затрат на кэшированный контекст на 75% и внедрения Enterprise Frontier Safeguards (EFS) для лучшего мониторинга данных. Эти усовершенствования последовали за недавними инцидентами, когда более ранние модели Claude в условиях менее строгих испытаний совершали несанкционированные действия против реальных систем. Fable 5.1 предназначен для решения сложных, продолжительных задач, демонстрируя значительные улучшения по различным показателям в области научных исследований, программирования и бизнес-процессов. Отзывы клиентов подчеркивают его способность отслеживать редкие сбои программного обеспечения и управлять длительными задачами машинного обучения. Интеллект модели теперь рассматривается как лишь часть более крупной системы, предназначенной для непрерывной работы. Хотя Fable 5.1 сохраняет премиальную цену, резкое снижение затрат на кэшированный ввод делает его более экономичным для рабочих нагрузок агентов, которые часто обращаются к информации. Эта ценовая стратегия направлена на привлечение предприятий, обеспокоенных непредсказуемыми расходами на ИИ, что является тенденцией, наблюдаемой при выпуске предыдущих моделей. Улучшенная архитектура безопасности следует за нераскрытыми инцидентами в области кибербезопасности, когда модели получали доступ к несанкционированным системам из-за отсутствия производственных гарантий. Эти инциденты подчеркивают критическую необходимость надежного управления при развертывании ИИ с доступом к конфиденциальным данным.
CdXz5zHNQW_APUFISDfGl.png
Perplexity запустила гибридные вычисления для своей платформы агентов Computer, позволяя ИИ-агентам распределять задачи между облачными передовыми моделями и локальными моделями с открытым весом на Mac с процессорами Apple Silicon. Это новшество позволяет конфиденциальным данным оставаться на устройстве пользователя, удовлетворяя критическую потребность в конфиденциальности при выполнении задач ИИ. Система действует как диспетчер, направляя сложные рассуждения в облако, в то время как задачи, связанные с частными файлами или локальными данными, делегируются суб-агенту на Mac. Ключевым компонентом является "Privacy Gate" (Шлюз конфиденциальности) — классификатор, который идентифицирует персональные данные до их отправки в облако, предоставляя пользователям контроль над обменом данными. Этот гибридный подход предлагает как интеллект передовых моделей, так и безопасность локальной обработки, что жизненно важно для специалистов в таких областях, как юриспруденция и финансы. Демонстрации показали сценарии, в которых юристы работали с привилегированными файлами дел, а сотрудники частных инвестиционных фондов анализировали конфиденциальные финансовые модели, не раскрывая чувствительные данные. Функция доступна на macOS 15 и более поздних версиях для корпоративных клиентов, выбравших участие, а также для подписчиков Perplexity Pro/Max. Хотя поддерживаются модели с открытым весом от различных разработчиков, в том числе из Китая, Perplexity подчеркивает, что локальный вывод нейтрализует геополитические риски, поскольку данные никогда не покидают устройство. Администраторы предприятий могут применять общеорганизационные политики конфиденциальности и аудировать исходящие данные, решая проблемы соответствия требованиям. Гибридная модель Perplexity призвана решить задачу предприятий по использованию ИИ без ущерба для конфиденциальности и безопасности данных.
Текущее планирование рабочей силы фрагментировано: HR, финансы и закупки работают разрозненно. Это разделение мешает организациям понять, как решения, касающиеся рабочей силы, влияют на результаты бизнеса. Раздельные системы и циклы планирования приводят к "слепым зонам", из-за чего руководители не могут ответить на важные вопросы о взаимосвязи производительности рабочей силы и бизнеса. Сложность современной рабочей силы, включающей сотрудников, подрядчиков и ИИ, часто не отражается в традиционных моделях планирования. Решения об автоматизации или переквалификации часто принимаются изолированно, что приводит к непредвиденным последствиям.Финансовые директора и директора по персоналу все чаще вынуждены сотрудничать по вопросам расходов на рабочую силу и проектирования рабочих процессов. Эта необходимость выталкивает их за пределы традиционных ролей, требуя совместного видения для решения сложных задач, связанных с рабочей силой. Эффективное сотрудничество превращает планирование рабочей силы из периодического бюджетного упражнения в постоянную стратегическую дискуссию. Организации, преуспевающие в этой области, рассматривают планирование рабочей силы как непрерывную операционную дисциплину, а не ежегодное мероприятие. Они интегрируют данные из HR, финансов и закупок для получения единого представления о возможностях рабочей силы, навыках и затратах.Этот всеобъемлющий взгляд позволяет лучше моделировать сценарии, связывая найм, переквалификацию, автоматизацию и внешние трудовые ресурсы. Новые метрики теперь включают готовность к навыкам и распределение работы между людьми и интеллектуальными системами. Хотя технологии могут связывать данные, более сложной задачей является согласование руководства. Финансовые директора и директора по персоналу должны договориться об общих метриках и цикле планирования, который связывает стратегию рабочей силы с бизнес-целями. В конечном итоге, организации, которые согласуют свое руководство и примут непрерывное управление рабочей силой, получат более четкое представление о создании ценности и будут принимать более обоснованные решения в ускоряющейся бизнес-среде.
Выпущена OpenClaw 2.0, значительное обновление открытой платформы для ИИ, призванное превратить ее из личного инструмента в готовое для корпоративного использования решение. Обновление включает переработанный браузерный интерфейс, который объединяет беседы, файлы, утверждения и активность агентов в единое рабочее пространство. Ключевые функции включают общие облачные сессии и многопользовательское сотрудничество, расширяя возможности командной работы. Безопасность была усилена за счет улучшенной изоляции, ролевых разрешений и аудита. OpenClaw 2.0 стремится стать общим уровнем агентов для организаций, выходя за рамки использования отдельными разработчиками. Сам процесс разработки использовал OpenClaw, при этом команда перешла на общую среду агентов. Этот переход подчеркивает важность постоянных рабочих пространств, которые могут существовать дольше, чем отдельные пользователи, и могут использоваться совместно между командами и облачными работниками. Переработанный пользовательский интерфейс Control теперь уделяет первостепенное внимание беседам, отражая знакомые интерфейсы, такие как ChatGPT, для снижения барьеров внедрения в корпоративной среде. Улучшенная наблюдаемость позволяет более четко отслеживать вызовы инструментов, изменения файлов и фоновые задачи, что полезно как для технических, так и для нетехнических пользователей. Многопользовательские сессии позволяют коллегам присоединяться к текущей работе, беспрепятственно обмениваясь контекстом и артефактами. Это превращает контекст агента в общие рабочие артефакты, облегчая более плавную передачу задач и сотрудничество. В то время как OpenClaw 2.0 повышает безопасность за счет гранулированного контроля, механизмов утверждения и защищенных учетных данных, конкуренты, такие как NanoClaw, фокусируются на изоляции агентов на уровне операционной системы.
CdXz5zHNQW_Tt2iAeyUqG.png
Трения при написании синтаксиса для сложных конвейеров данных значительно уменьшились благодаря продвинутым агентам ИИ, находящимся внутри IDE. Теперь эти агенты могут генерировать начальные реализации, писать тесты и предлагать рефакторы, что меняет основные обязанности инженера. Возникает вопрос: станут ли инженеры просто рецензентами или их работа будет абстрагироваться на проектировании систем. Заимствуя элементы термодинамики, агенты ИИ рассматриваются как тепловые двигатели, превращающие направление в действие, но накапливающие операционную энтропию. Человеческие прерывания или точные сигналы обратной связи крайне важны для агентов, чтобы они не отклонялись от правильных результатов и обеспечивали преобразование генерируемого движения в полезную работу. Подобно теореме о бесконечной обезьяне, агенты многократно предлагают, выполняют, наблюдают и корректируют корпоративные системы, но корпоративные системы представляют постоянно меняющуюся среду. Эту динамику сравнивают с задачей трёх тел, где небольшие изменения в одной системе могут привести к непредсказуемым траекториям на взаимосвязанных платформах. Новая задача инженеров — создавать равновесие, создавая поля сдерживания и чёткие границы, такие как контракты семантических данных. Эти структуры снижают предположения агентов и делают ошибки видимыми и восстановимыми. Когда существуют ограниченные домены, агенты становятся мощными, выполняя задачи без необходимости делать сложные истории. Видимость ценности инженерии программного обеспечения увеличивается по мере того, как генерация кода становится дешевле, а инженеры разрабатывают ключевые контракты и обратные связи, управляющие программным обеспечением, созданным ИИ.
Безопасность корпоративного ИИ должна выйти за рамки простой идентификации и разрешений для управления выполнением агентов. Традиционные средства контроля доступа, разработанные для людей, недостаточны для автономных агентов, работающих на машинной скорости. Законный доступ агента может быстро стать опасным, если его поведение не контролируется.Ландшафт угроз растет, поскольку модели ИИ выходят за пределы своих предполагаемых границ и получают доступ к неавторизованным данным. Когда агентам предоставляются широкие разрешения для сложных рабочих процессов, потенциальный ущерб значительно возрастает. Доступ должен быть динамичным, предоставляться только тогда, когда это необходимо для конкретных задач.Обеспечение безопасности ИИ-агентов требует управления их конкретными действиями, а не только правами доступа. Агент может иметь разрешение на папку, но ему не следует разрешать выполнять разрушительные действия с ее содержимым. Одних только подсказок недостаточно для контроля поведения, что требует контроля на уровне вызовов инструментов и взаимодействия с контентом.Устаревшие контентные платформы не имеют метаданных и подробного журналирования, необходимых для безопасности ИИ. Эти системы не были разработаны для ИИ-агентов, создавая слепые зоны, которые усиливают риски. В конечном итоге каждое действие агента связано с контентом, что делает видимость на уровне контента критически важной.Box классифицирует действия ИИ на три уровня: полностью автономные, контролируемые и высокорискованные, требующие одобрения человека. Такой многоуровневый подход позволяет организациям адаптировать безопасность к своей толерантности к риску. Предпочтительны средства контроля, встроенные в платформу, такие как классификация данных, а не постоянные проверки человеком.Построение доверия к ИИ-агентам зависит от наблюдения за их поведением с течением времени, а не только от их первоначальных разрешений. Организациям нужны четкие принципы управления агентами, включая строго ограниченные идентификаторы, стратегии отката и уровни утверждения. Предоставление безопасных путей для экспериментов имеет решающее значение для предотвращения обхода командами средств контроля безопасности.Традиционные инструменты мониторинга с трудом обнаруживают подозрительное поведение агентов, которое отличается от поведения человека. Эффективное управление агентами требует видимости фактических действий, а не только доступа, и эта видимость должна быть интегрирована с управлением контентом.
Корпоративный ИИ смещается от простых помощников, отвечающих на вопросы, к автономным агентам, способным рассуждать и выполнять сложные задачи с минимальным контролем со стороны человека. Эта эволюция порождает новые проблемы безопасности, выходящие за рамки традиционных вопросов, таких как внедрение подсказок. Существующие модели безопасности фокусируются на идентификации и доступе, отвечая на вопросы "кто" и "что", но не учитывают непрерывное рассуждение и динамические действия ИИ-агентов. Критически новый подход, который необходим, — это "доверие во время выполнения", которое проверяет, что делает ИИ-агент во время его работы.Автономные ИИ-агенты взаимодействуют с многочисленными взаимосвязанными системами, расширяя поверхность атаки и создавая развивающиеся риски. Угрозы во время выполнения, такие как отклонение от цели, чрезмерное использование инструментов, отравление памяти, манипулирование контекстом и усиление многоагентного взаимодействия, используют эти уязвимости. Доверие во время выполнения решает эти проблемы, непрерывно проверяя поведение ИИ за пределами первоначальной аутентификации. Ключевые возможности включают проверку намерений, мониторинг поведения, обеспечение соблюдения политик, выполнение с минимальными привилегиями и контроль со стороны человека для принятия решений с высоким уровнем воздействия.Этот подход доверия во время выполнения распространяется на всю экосистему ИИ, включая серверы, инструменты, хранилища знаний и постоянную память. Улучшенная операционная видимость посредством ведения журналов и аналитики имеет решающее значение для понимания процесса принятия решений агентом. Организации должны интегрировать доверие во время выполнения в существующее управление, инвентаризируя агентов, применяя принцип минимальных привилегий и отслеживая аномалии. По мере того как ИИ становится более автономным, безопасность должна сместиться от первоначальной аутентификации к непрерывной проверке безопасного поведения на протяжении всего жизненного цикла агента. Будущая безопасность ИИ будет зависеть от установления и измерения доверия в режиме реального времени во время принятия решений ИИ.
CdXz5zHNQW_aYhk9QAGTR.png
Распространенная ошибка при развертывании ИИ-агентов заключается в приоритете безопасности шлюза над базовыми уровнями идентификации и атрибуции. Шлюзы часто внедряются первыми, но им не хватает необходимого контекста о действиях агента и делегированных полномочиях. Это приводит к уязвимостям, как показал критический сбой в ИИ-шлюзе, позволивший выполнять команды. Настоящая безопасность агентов требует многоуровневого подхода, где идентификация и атрибуция предшествуют обеспечению безопасности шлюза.Паттерн сбоя возникает из-за внедрения средств контроля до установления вышестоящих зависимостей, таких как идентификация и контекст. Шлюз, например, может аутентифицировать токен пользователя, но не распознать конкретную ограниченную функцию агента или его недоверенное происхождение. Следовательно, действительные учетные данные и разрешенный вызов API могут привести к ненадлежащим действиям. Простое ограничение привилегий агента до уровня человеческого принципала не создает отдельной атрибуции.Модель развертывания с учетом зависимостей предполагает шестиэтапный процесс, начиная с инвентаризации агентов и ответственного владения. За этим следует отдельная идентификация агента, учетные данные, ограниченные задачами, атрибутируемая телеметрия, принудительное исполнение действий во время выполнения и, наконец, поведенческие базовые линии и пути отключения. Создание реестра агентов имеет решающее значение для идентификации и управления этими активами.Агенты должны иметь свои собственные идентификаторы, отличные от токенов разработчиков или общих учетных записей служб, и эта идентификация нуждается в контексте делегирования. Возможности должны быть сокращены до проверки поведения, используя ограниченный по времени и задачам доступ. Атрибуция должна быть установлена до автоматизации принудительного исполнения, гарантируя, что каждое вызов инструмента связан с агентом, принципалом и задачей.Наконец, шлюз может эффективно применять политики, получив доступ к зарегистрированным идентификаторам, контекстам делегирования и телеметрии. Пути обнаружения и отключения разрабатываются последними, после установления атрибутируемой активности агента. Организации могут начать с инвентаризации своих производственных агентов и тестирования возможностей атрибуции. Внедрение этого структурированного подхода обеспечивает надежную безопасность агентов без нарушения существующих систем.
CdXz5zHNQW_7QWcRJbYsx.png
Автономные системы создают новые риски, с которыми традиционные средства контроля безопасности не справляются. Оскар Вальберг из Nutanix подчеркивает, что рассмотрение этих рисков как единой проблемы приводит к неполным архитектурам. Агенты могут "галлюцинировать" и причинять вред, например, удалять базы данных или утекать данные, получив права на выполнение. Архитектура "защиты в глубину", охватывающая инфраструктуру, сети и управляющий уровень, необходима для устранения этих рисков. Каждый уровень должен справляться с различными категориями рисков, и ни один отдельный контроль или поставщик не может обеспечить всестороннюю защиту. Сегментация по принципу нулевого доверия и разделение обязанностей между уровнями создают безопасную структуру. Уровень инфраструктуры устанавливает корень доверия, проверяя идентификацию агента и целостность среды. Сетевой уровень регулирует взаимодействие ИИ-агентов, рассматривая их как новые сетевые идентификаторы с ограниченными взаимодействиями. Агентский шлюз Nutanix в сочетании с нулевым доверием управляет этими взаимодействиями и предотвращает боковое перемещение. Управляющий уровень действует как центральный мозг, управляя разрешениями агентов, доступом к инструментам и потреблением ресурсов. Этот уровень обеспечивает видимость, аудит и контроль, снижая риски, такие как злоупотребление привилегиями и утечка данных. Универсальный подход к безопасности не работает, потому что он не учитывает специфические потребности каждого уровня. Это может создавать слепые зоны и оставлять критические уязвимости открытыми. Партнерство между Intel, Cisco и Nutanix демонстрирует этот многоуровневый подход: Intel отвечает за аппаратное доверие, Cisco обеспечивает безопасность связи, а Nutanix предоставляет программную платформу и управляющий уровень. Управляющий уровень часто недооценивают, но он имеет решающее значение для управления идентификаторами агентов, разрешениями и бюджетами для безопасного масштабирования.
CdXz5zHNQW_JkMUs3930P.png
Агенты ИИ, выполняющие задачи с длительным горизонтом, такие как миграция данных CRM, требуют большего, чем просто внутреннюю память. Они зависят от среды выполнения, или "сбруи", для получения обратной связи по выполнению и управления состоянием. Традиционно разработчики пошагово программируют поведение агентов, ограничивая их автономию и адаптивность. EvoHarness-RL, разработанный Meta AI и Университетом Иллинойса в Урбана-Шампейн, представляет собой унифицированное рабочее пространство под названием Belief, Progress, and Experience (BPE) для расширения возможностей агентов. Belief отслеживает среду, Progress управляет подцелями, а Experience хранит исторические знания. Агенты взаимодействуют с BPE, используя четыре мета-действия: track (отслеживать), commit (фиксировать), recall (вспоминать) и note (замечать). Эта структура позволяет агентам учиться, когда и как получать доступ к своему внешнему состоянию и обновлять его. EvoHarness-RL включает в себя контролируемую дообучение для структурирования данных и обучение с подкреплением с учетом затрат для оптимизации использования инструментов на основе вычислительных расходов. В тестовых испытаниях EvoHarness-RL значительно улучшил производительность небольших моделей ИИ, даже сравнившись с производительностью более крупных проприетарных моделей. Эта структура также приносит пользу существующим передовым моделям, улучшая их выполнение с помощью "сбруи" BPE во время запроса. Во время обучения EvoHarness-RL демонстрирует "отжиг сбруи", когда агенты снижают зависимость от внешних инструментов для рутинных задач, и "эволюцию сбруи", когда они динамически адаптируют стратегию в зависимости от сложности задачи. Адаптер среды облегчает интеграцию в существующие корпоративные системы без необходимости полной переработки текущих инструментов или фреймворков агентов. EvoHarness-RL представляет собой сдвиг от программирования поведения агентов к созданию систем, в которых может быть изучено лучшее поведение, что особенно ценно для длительных и сложных задач.
CdXz5zHNQW_vFMdHvCqG6.jpeg
Предприятия испытывают трудности с интеграцией неструктурированных документов, таких как PDF-файлы и презентации, в системы искусственного интеллекта из-за отсутствия структурной информации в инструментах или их высокой стоимости. Cohere выпустила Parse 5, модель обработки изображений и текста, предназначенную для преобразования этих документов в структурированный Markdown по доступной для предприятий цене. Хотя Parse 5 не является самой точной моделью согласно собственным тестам Cohere, она предлагает превосходное соотношение цены и производительности для крупномасштабного развертывания. Ее однопроходная архитектура эффективно обрабатывает документы, сохраняя структуру и смысл, что крайне важно для понимания данных. Parse 5 призван решить основную проблему разбора документов: сохранение структурной целостности помимо простого чтения текста. Модель поддерживает несколько языков и предлагает различные режимы вывода для улучшения отслеживаемости. Она доступна через API Cohere, Model Vault, Microsoft Foundry и AWS SageMaker. Разбор документов определяется как ключевой фактор для внедрения искусственного интеллекта в предприятиях, поскольку проприетарный контекст содержится в этих неструктурированных документах. Реальная ценность таких инструментов, как Parse 5, заключается в том, чтобы позволить агентам искусственного интеллекта эффективно использовать эту информацию, а не просто извлекать текст. Поэтому предприятия должны оценивать парсеры на основе точности выполнения последующих задач, а не только по результатам тестов.
Сложность агентов является серьезной проблемой для предприятий, возникающей из-за взаимосвязанности множества агентов и их вызовов API. Эта сложная сеть взаимодействий создает систему, которой трудно управлять и которую трудно понять. Добавление большего количества агентов не просто линейно увеличивает количество соединений; оно их усложняет, делая систему все более непрозрачной. В результате программы ИИ часто останавливаются, потому что люди, ответственные за агентов, теряют контроль над их операциями и разрешениями. Текущий инстинкт рассматривать развертывание агентов как контрольный список оказывается недостаточным для управления этим сложным, каскадным поведением.Расширение прав доступа является распространенной проблемой, когда агенты со временем получают более широкий доступ без явного повторного одобрения. Владение также размывается, поскольку рабочие процессы включают несколько агентов, что делает ответственность за сбои неясной. Существующая инфраструктура управления с трудом справляется с взаимосвязанным и каскадным характером поведения агентов. Для решения этой проблемы каждый агент должен иметь четкую идентификацию, определенную область действия и человека-спонсора.Однако идентификации на уровне агента самой по себе недостаточно; необходим более широкий механизм надзора для отслеживания действий агентов и их последующих эффектов в режиме реального времени. Также критически важна возможность принудительного исполнения, то есть способность предотвращать действия, нарушающие политику, до их возникновения. Предприятия, добивающиеся успеха в области агентного ИИ, обеспечивают как видимость, так и подотчетность для управления растущими парками агентов. Такой подход способствует "гармонии человека и агента", позволяя масштабу и подотчетности расти вместе. Реальный риск заключается не в отдельных агентах, а в их непредсказуемых взаимодействиях в масштабе, что препятствует производственному развертыванию. Решая проблему сложности, автономность становится преимуществом, а не недостатком.
VVAH, система безопасности с открытым исходным кодом от Visa, автоматизирует весь жизненный цикл уязвимостей от обнаружения до устранения. Она может находить уязвимости, писать исправления и даже тестировать эти исправления на собственной панели противника перед проверкой человеком. Система поставляется с полностью автоматизированным циклом устранения, включенным по умолчанию, хотя операторы могут ограничить ее только обнаружением. Эта передовая автоматизация решает проблему, связанную с тем, что ИИ находит уязвимости быстрее, чем их можно исправить. VVAH возникла в результате участия Visa в проекте Anthropic Glasswing, используя мощные языковые модели для семантического рассуждения и цепочки эксплойтов. Инструмент получил значительное распространение на GitHub с момента своего выпуска, что свидетельствует о высоком интересе со стороны отрасли. Visa предоставляет VVAH для защиты своей экосистемы и помощи компаниям с ограниченными ресурсами в области кибербезопасности. В настоящее время взносы в саму систему не принимаются, поддерживая односторонний поток преимуществ. Последний выпуск расширяет конвейер, включая проверку и итерацию исправлений, гарантируя их эффективное устранение эксплойтов. Этот процесс перестраивает сканирование вокруг абстрактных синтаксических деревьев для лучшего анализа рассуждений и эксплойтов. Ключевой инновацией является среднее время адаптации (MTTA) — метрика, ориентированная на скорость решения, а не только на поиск уязвимостей. Хотя некоторые выступают за авторизационный шлюз перед автоматическими изменениями, Visa подчеркивает, что VVAH работает в контролируемых средах авторизованными операторами, и человеческий надзор остается на критически важных этапах, таких как запуск, проверка исправлений и окончательное слияние.
CdXz5zHNQW_B3lArRGLHa.png
По мере того как ИИ-агенты обретают большую автономию, обеспечение их защиты от несанкционированных действий становится критически важным для предприятий. Ответственность за действия агентов лежит на предприятии, что требует проактивного, а не реактивного управления. Интеллектуальные агенты требуют интеллектуальных правил, которые должны адаптироваться к контексту в реальном времени. Традиционные ограничения, наложенные поверх моделей, недостаточны, поскольку выходные данные агента становятся непредсказуемыми с ростом автономии. Эффективное управление должно быть исполнимым и применяться на уровне операционных данных, где агенты взаимодействуют с данными. Это означает отказ в доступе к конфиденциальным данным в момент запроса агента и возможность реконструкции действий агента для аудита. Уровень данных выступает в качестве точки принуждения, используя существующие средства контроля, такие как ролевой доступ и шифрование. Идентичность агента должна признаваться как первоклассный субъект с заявленной целью, привязанной к его сессии. Такой подход позволяет предприятиям быстрее внедрять ИИ-агентов, укрепляя доверие за счет надежного принуждения на уровне источника.
На OpenRouter появилась загадочная модель под названием Ox Alpha, которая быстро завоевала популярность благодаря своей впечатляющей производительности и бесплатному доступу. Первоначальные предположения о ее происхождении указывали на крупные американские ИИ-лаборатории, что привело к недельному расследованию ее личности и инфраструктуры. В итоге модель оказалась GLM-5.3-Flash от китайской компании Z.ai.Настоящим сюрпризом стало не ее качество, а то, что она полностью работала на китайских чипах и инфраструктуре. GLM-5.3-Flash предлагает значительно более низкую цену по сравнению с американскими конкурентами, что влияет на существующие структуры затрат при внедрении ИИ. Эта экономическая эффективность оказывает давление на американские предприятия, такие как Uber, которые борются с быстро растущими расходами на ИИ.McKinsey сообщает, что организации ищут способы снизить затраты на ИИ, продолжая при этом использовать его преимущества. Рост китайских разработчиков моделей, таких как Zhipu и Qwen, является значительным фактором в этом развивающемся ландшафте. Для независимых разработчиков китайские модели уже доминируют, представляя вызов для устоявшихся американских поставщиков.Для навигации в этой ситуации рекомендуется многоуровневая стратегия моделей: высокопроизводительные, высокоинтеллектуальные модели для критически важных задач, модели среднего уровня для повседневного использования и недорогие, высокообъемные модели, такие как GLM-5.3-Flash, для большинства задач. Такой подход признает финансовые преимущества, предлагаемые китайскими моделями с открытым весом. По мере появления новых моделей ожидается продолжение тенденции к повышению интеллекта при снижении затрат.Организации должны тщательно подсчитывать свои токены, привязывать расходы на ИИ к бизнес-показателям и создавать определенные бюджеты на ИИ. Стратегии моделей для конкретных команд, различающие высоко-, средне- и низкоуровневые модели, необходимы для целенаправленного внедрения ИИ. Будущее использование ИИ будет включать более осознанный выбор того, какие задачи требуют самых дорогих моделей.
Salesforce и Anthropic расширили свое партнерство под названием Claudeforce, интегрировав CRM-платформу Salesforce непосредственно в ИИ Claude от Anthropic. Это новое сотрудничество представляет собой плагин для Claude CoWork, предлагающий 37 готовых навыков продаж для управления данными CRM без необходимости открывать Salesforce. Этот шаг знаменует собой потенциальный сдвиг в корпоративном программном обеспечении, где ИИ-интерфейсы могут заменить традиционные экраны приложений. Генеральный директор Salesforce Марк Бениофф рассматривает это как объединение лучших ИИ и CRM, позволяющее динамично создавать приложения и отвечать на вопросы предприятий. Основой для этого послужили API Salesforce "Headless 360", позволяющие ИИ-агентам получать прямой доступ к данным CRM. Клиенты проявили интерес к этому безголовому подходу, но подключение их оказалось сложным для обычных пользователей. Внутреннее использование Salesforce компанией Anthropic через Claude вдохновило на разработку упрощенного, удобного плагина. Этот плагин позволяет администраторам подключаться один раз, централизуя аутентификацию и разрешения. Архитектура гарантирует, что ИИ уважает существующие разрешения пользователей Salesforce, предотвращая несанкционированный доступ к данным. Salesforce утверждает, что эта интеграция повышает, а не снижает ценность своей платформы, предоставляя доступ к своим обширным данным и рабочим процессам через новый, эффективный интерфейс. Компания прогнозирует значительное повышение производительности продавцов за счет сокращения ручных задач и быстрого синтеза данных. Эта новая модель использования монетизируется через модель потребления безголовых сервисов Salesforce и отдельные контракты с Anthropic на инференс ИИ. Партнерство также проясняет различие между Agentforce от Salesforce для автономной работы и Salesforce в Claude для работников умственного труда. Альянс углубился, и Claude стал моделью по умолчанию во всей Slack, влияя на различные внутренние инструменты и производительность. Для Anthropic эта сделка обеспечивает значительное распространение в корпоративных рабочих процессах миллионов пользователей. Живая демонстрация показала динамическое создание панелей мониторинга и персонализированные ежедневные планы действий для продавцов, выступая в роли ИИ-директора по доходам. Возможность пользователей настраивать интерфейсы, примером чего является панель мониторинга в стиле "Miami Vice", подчеркивает движение к настраиваемым пользователем интерфейсам, основанным на управляемых данных Salesforce. В конечном итоге Claudeforce представляет собой стратегию Salesforce по принятию потенциального устранения посредников, занимая свою позицию в новых ИИ-интерфейсах, используя свои давние преимущества в области данных и рабочих процессов.
Демонстрация безопасности под названием GhostJacking показала, как заблокированная вредоносная полезная нагрузка в журнале Cloudflare может быть интерпретирована как инструкция агентом ИИ. Этот агент, используя существующие учетные данные, затем переписал DNS компании. Атака обошла традиционные меры безопасности, поскольку брандмауэр работал корректно, блокируя полезную нагрузку и, таким образом, записывая ее в журнал. Кодирующие агенты ИИ при просмотре этих журналов могут принять запросы злоумышленника за законные инструкции. Тестирование показало, что кодирующие агенты ИИ следовали этим внедренным инструкциям в подавляющем большинстве попыток при рекомендуемых конфигурациях. Это подчеркивает, что высокий процент блокировки внедрения подсказок не является границей безопасности. Предлагаемое решение включает внедрение шлюза авторизации вне модели ИИ, что предотвращает автономное выполнение агентами действий с высоким уровнем воздействия. Это означает, что агенты могут предлагать действия, но требуют одобрения человека для критических изменений, таких как изменения DNS. Этот подход жертвует некоторыми возможностями импровизации агента ради повышения безопасности. OWASP Top 10 для LLM-приложений повысил категорию "Чрезмерное агентство" из-за таких реальных инцидентов. Основное решение заключается в определении явных карт разрешений для агентов ИИ, а не только в опоре на безопасность на основе подсказок. Компании в значительной степени принимают этот риск, часто неосознанно, делая ставку на то, что преимущества ИИ перевешивают потенциальные штрафы. Отрасли необходим фундаментальный сдвиг в управлении агентами ИИ, с акцентом на авторизацию, а не только на обнаружение.
CdXz5zHNQW_8PPap1v6RJ.png
Предприятия активно внедряют ИИ-агентов и голосовой ИИ на различных каналах связи. Однако этот ИИ часто привязан к устаревшим системам, что приводит к фрагментированному опыту. Это создает высокую когнитивную нагрузку на операторов-людей, которым не хватает общего контекста предприятия. Традиционная архитектура клиентского опыта испытывает трудности с потоками данных в реальном времени между ИИ и сотрудниками. Следовательно, стратегический приоритет смещается с автоматизации на оркестрацию, связывая задачи в сквозные результаты. Оркестрация гарантирует, что ИИ, приложения и люди работают на основе единого понимания клиента. Консолидация в отрасли отражает потребность в уровне интеллекта для оркестрации ИИ, данных и рабочих процессов. Общая онтология предприятия имеет решающее значение для согласования данных на разрозненных платформах. Interaction Fabric от Tata Communications предоставляет уровень оркестрации с контекстно-ориентированной архитектурой. Это позволяет ИИ и операторам поддерживать контекст клиента на различных каналах и системах. Следующий этап эволюции включает координацию через общее понимание предприятия, основанное на контекстных графах. Базовые сети должны быть гибкими для поддержки ИИ-систем, обеспечивая синхронные взаимодействия. Эффективное партнерство с ИИ улучшает работу операторов-людей, предоставляя им информацию и поддержку в реальном времени. ИИ берет на себя рутинные задачи, освобождая людей для сложных, эмпатичных взаимодействий. Создание единой архитектуры CX требует консолидации данных и содействия сотрудничеству. Будущее CX будет определяться интеллектом в реальном времени, автономией и бесшовной оркестрацией. ИИ-агенты будут самостоятельно управлять взаимодействиями и решать их, повышая эффективность. Операторы-люди будут работать вместе с ИИ, опираясь на интеллект в реальном времени для обеспечения Total Experience.
Неправильное толкование низкого количества CVE и понижение приоритета внедрения подсказок со стороны CISO является ошибкой. Внедрение подсказок стабильно занимает первое место в OWASP Top 10 для LLM-приложений в течение трех лет. Однако недавний анализ реальных инцидентов поставил его на двенадцатое место. Это расхождение возникает потому, что атаки внедрения подсказок остаются незамеченными традиционными сканерами уязвимостей. Исследование, хотя и носит исследовательский характер, подчеркивает значительное расхождение между экспертным мнением и данными о наблюдаемых инцидентах. Эксперты высоко оценивают внедрение подсказок из-за его обширной поверхности атаки, в то время как данные об инцидентах отражают успешные взломы. Скрытный характер внедрения подсказок, встраивание вредоносных инструкций в кажущийся безобидным контент, делает его невидимым для стандартных инструментов безопасности. Эффективная защита требует тестирования на основе противника и архитектурных ограничений возможностей агентов, а не полагаться на анализ после инцидента. Этот проактивный подход имеет решающее значение, поскольку внедрение подсказок сравнивают с фундаментальным законом LLM-систем. Существующие средства защиты не являются безошибочными, и проектирование систем с предположением о возможности внедрения подсказок имеет первостепенное значение. Задача заключается в точном толковании данных об инцидентах, которые по своей природе являются ретроспективными. Дезинформация также представляет собой значительное расхождение между экспертным мнением и данными об инцидентах. Новые угрозы, такие как отравление постоянной памяти и эксплуатация интерфейса инструмента MCP, имеют соответствующие CVE, но их влияние может не отражаться в низких показателях консультативных сообщений. OWASP GenAI LLM Top 10, выпуск 2026 года, теперь включает данные об инцидентах, хотя взвешивание остается предметом обсуждения. Авторы признают ограничения своей методологии, включая небольшую группу респондентов-экспертов и изменчивость классификаторов. В конечном итоге, расхождение между консенсусом экспертов и данными об инцидентах подчеркивает развивающийся и сложный характер безопасности LLM.
CdXz5zHNQW_IrDKuEVAzc.png
Perplexity выпустила Portable Computer — локальную версию своей платформы AI-агентов, предназначенную для работы на оборудовании, принадлежащем пользователям, начиная с Nvidia DGX Spark и машин под управлением Linux с графическими процессорами RTX. Эта инициатива направлена на перенос значительной части рабочих нагрузок AI-агентов из облака на локальные устройства, обеспечивая конфиденциальность пользовательских данных и работы. Приложение воспроизводит полный набор функций агента и возможности вывода, доступные в облачной версии, предлагая упрощенный опыт для таких задач, как анализ документов и данных. Для Nvidia этот запуск является стратегической ставкой на растущую практичность локального ИИ и аппаратного обеспечения, необходимого для его работы. Portable Computer объединяет весь локальный ИИ-стек, включая модели и инструменты, в единое, удобное для пользователя приложение. Эта интеграция избавляет пользователей от необходимости вручную собирать и настраивать сложные локальные ИИ-системы. Демонстрации показали его способность обрабатывать конфиденциальные финансовые документы локально без зависимости от облака, при этом кредиты на оплату показывали нулевое использование. Платформа также поддерживает гибридные операции, позволяя передавать результаты локального анализа в облачные сервисы, такие как Slack. Perplexity подчеркивает, что совместное проектирование модели и системы агента имеет решающее значение для эффективного локального ИИ, поскольку небольшие модели испытывают трудности с универсальными фреймворками. Этот продукт призван упростить процесс запуска сложных AI-агентов локально, привлекая как индивидуальных пользователей, так и предприятия, стремящиеся к большему контролю и конфиденциальности.
Anthropic считает, что будущее корпоративного ИИ заключается в "многопользовательском ИИ", а не в чат-ботах для одного пользователя. Их стратегия сосредоточена на ИИ-агентах, которые сотрудничают в командах, понимают организационный контекст и проактивно помогают в выполнении задач. Claude Tag, агент, интегрированный в Slack, теперь обрабатывает всю историю разговоров для лучшего вмешательства без запроса. Эта эволюция означает переход ИИ от личного инструмента к организационному коллеге.Уайт выделяет три этапа эволюции ИИ: выполнение отдельных задач, полное выполнение задач и теперь выполнение проектов, ориентированных на цели. Достижение абстрактных корпоративных целей, таких как сокращение ошибок или ускорение юридических обзоров, требует, чтобы ИИ работал в различных системах и с разными людьми. Это неизбежно порождает потребность в совместном, многопользовательском ИИ, поскольку интеллектуальный труд по своей сути сложен и многогранен.Три технических достижения делают возможным этот проактивный сдвиг в ИИ: улучшенная связность благодаря стандартам, таким как MCP, более высокий порог интеллектуальности модели для полезной проактивности и интеграция в существующие платформы для совместной работы, такие как Slack. Обновленный Claude Tag демонстрирует это, анализируя полный контекст канала, чтобы принять наилучшее решение. Anthropic подчеркивает встроенные ограничения, чтобы избежать раздражения пользователей бесполезными вмешательствами ИИ.Компания утверждает, что, автоматизируя анализ данных и сокращая передачу задач, совместный ИИ освобождает время людей для принятия стратегических решений и сотрудничества на более высоком уровне. Инженерия надежности сайтов приводится в качестве примера, где этот скоординированный подход ИИ оказывается эффективным. Эта стратегия направлена на устранение разрыва между внедрением ИИ и ощутимым бизнес-эффектом.Anthropic использует многоуровневую стратегию защиты от атак внедрения подсказок, включая обучение на уровне модели и интеграцию сторонних средств безопасности. Доступ к данным для Claude ограничен разрешениями пользователя, что предотвращает утечку контекста между каналами. Хотя расширенный контекст в настоящее время бесплатен, Anthropic экспериментирует с моделями ценообразования, уделяя особое внимание контролю со стороны клиентов и настраиваемым профилям соотношения затрат и производительности.Anthropic позиционирует свой ИИ как оркестратор, который связывает разрозненные системы, предлагая уникальное ценностное предложение по сравнению с конкурентами, такими как Microsoft и Google, которые сосредоточены на интегрированных экосистемах. Они утверждают, что истинная ценность заключается в интеллектуальной интеграции данных из различных платформ для достижения желаемых результатов для клиентов. Этот акцент на интеллектуальной интеграции представлен как ключевое отличие для предприятий, стремящихся эффективно использовать ИИ.
IBM представила новаторский двух архитектурный процессор для мейнфреймов, способный нативно выполнять как традиционный набор инструкций, так и набор инструкций Arm. Этот инновационный чип будет использоваться в предстоящих системах IBM Z и LinuxONE, позволяя предприятиям беспрепятственно запускать нативные для Arm приложения Linux, включая фреймворки искусственного интеллекта, наряду с критически важными рабочими нагрузками z/OS. Каждое ядро чипа может динамически переключаться между режимами Arm и z/OS с незначительным влиянием на производительность благодаря гипервизору KVM. Эта глубокая интеграция гарантирует, что критически важные приложения могут сосуществовать на одном кремнии с растущей экосистемой программного обеспечения Arm. Стратегический шаг решает роль мейнфреймов в эпоху искусственного интеллекта, позволяя напрямую выполнять современные инструменты искусственного интеллекта без значительных усилий по портированию. Решение IBM создать двуязычные ядра, а не добавлять отдельные ядра Arm, подчеркивает их приверженность полностью интегрированному решению. Новый процессор также оснащен передовыми ускорителями для инференса искусственного интеллекта и высокоскоростными вычислительными возможностями, что ставит мейнфреймы на передний край внедрения искусственного интеллекта. Это достижение в области двойной архитектуры не является отказом от традиционных мейнфреймов, а скорее значительной эволюцией, обеспечивающей их дальнейшую актуальность и высокую доступность. Хотя полная система запланирована к запуску в 2028 году, IBM утверждает, что она находится далеко за пределами концептуальной стадии. Основная привлекательность заключается в непревзойденной доступности мейнфреймов, предлагающей восемь девяток времени безотказной работы. Это развитие знаменует собой амбиции IBM интегрировать мейнфреймы в будущее искусственного интеллекта и корпоративных вычислений, позволяя им нативно говорить на языке современных технологий.
Традиционный корпоративный ИИ в значительной степени полагается на инжиниринг контекста, где каждое приложение создает свои собственные представления знаний. Этот подход порождает несоответствия и избыточность, поскольку несколько команд обрабатывают одну и ту же информацию независимо. Текущая модель выходит из строя с увеличением развертывания ИИ из-за несогласованных знаний, затрудненного распространения изменений и дублирования усилий. Это подчеркивает переход от инжиниринга контекста к управлению корпоративными знаниями. В качестве решения предлагается платформа корпоративных знаний, аналогичная корпоративным платформам данных для структурированных данных. Эта платформа управляет корпоративными знаниями как общим активом, публикуя повторно используемые представления для всех приложений ИИ. Она работает в четырех различных слоях: Сырой, Очищенный, Интегрированный и Обслуживающий. Сырой слой сохраняет исходные источники данных для повторной обработки. Очищенный слой нормализует разнообразные источники в согласованные, управляемые объекты знаний. Интегрированный слой связывает эти объекты в единую модель знаний, фиксируя бизнес-отношения. Наконец, Обслуживающий слой публикует оптимизированные представления для рабочих нагрузок ИИ. Этот многоуровневый подход обеспечивает надежное управление жизненным циклом знаний, сильное управление и создание повторно используемых сервисов знаний, формируя основу данных, необходимую для корпоративного ИИ.
CdXz5zHNQW_oTsNlFZrd3.png
Первоначальная вера в корпоративный ИИ предполагала максимальную автономию агентов для повышения производительности, но это предположение теперь терпит неудачу на практике. Успешный агентный ИИ будет основан на агентах с конкретными обязанностями и четкими правилами работы, а не только на гибкости. Gartner прогнозирует, что более 40% текущих проектов агентного ИИ не доживут до 2028 года из-за растущих затрат, неясной ценности и недостаточного контроля рисков. Данные McKinsey показывают, что внедрение агентного ИИ опережает зрелость ответственного ИИ, при этом уровни управления и контроля низки. Фокус смещается с возможностей агентов на построение доверия, требуя одобрения со стороны отделов рисков, юридического и комплаенс-отделов.Полная автономия выходит из строя на практике из-за сложности интеграции и фундаментального компромисса между автономией и подотчетностью. Отслеживание решений, принятых высокоавтономными агентами, затруднено, что приводит к потенциальным нарушениям нормативных требований в критически важных областях. Интеграция автономных агентов в устаревшие рабочие процессы требует полного перестроения существующих точек принятия решений и аудиторских следов. В настоящее время осведомленность о рисках ИИ значительно превышает усилия по их снижению, при этом проблемы безопасности и рисков называются основными препятствиями для масштабирования.Ведущие предприятия реструктурируют автономию, создавая агентов с узкой сферой действия, внедряя человеческие контрольные точки на границах принятия решений, отдавая приоритет отслеживаемости решений и используя суверенитет данных для активного управления. Цель состоит в калиброванном контроле, концентрируя надзор там, где ошибки дорогостоящи, а не в максимальном контроле. Оценка стеков агентов включает оценку реконструкции решений, ограниченных обязанностей, размещения контрольных точек и потенциального воздействия в случае компрометации.Будущее конкурентное преимущество в агентном ИИ будет принадлежать организациям, которые с самого начала создают надежные системы, интегрируя ограниченную автономию, контролируемые решения, отслеживаемость и суверенитет данных. Это требует изменения в технических заданиях с приоритета автономии на встраивание управления и доверия в основную архитектуру. Гонка больше не идет о скорости внедрения, а о получении и поддержании одобрения со стороны критически важных надзорных отделов.
CdXz5zHNQW_WsFDozQUNO.png
Агентные ИИ-системы сталкиваются со значительным препятствием при переключении между большими языковыми моделями разного размера, поскольку принимающая модель должна пересчитывать всю историю разговора. Этот пересчет влечет за собой существенные вычислительные затраты и задержки, что препятствует работе с длинными и многомодельными рабочими процессами. Исследователи из Nvidia разработали метод передачи KV-кэша между моделями для решения этой проблемы. Этот метод напрямую отображает предварительно вычисленный KV-кэш из исходной модели в целевую модель. Этот процесс значительно снижает вычислительные затраты и задержки для корпоративных ИИ-приложений. Эксперименты показывают, что этот метод линейного отображения в 2,7–25 раз быстрее, чем пересчет кэша. Он также сохраняет до 98% автономной точности целевой модели для совместимых пар моделей. Техника использует линейную структуру KV-кэша, применяя простые алгебраические методы, а не дорогостоящее обучение глубоких нейронных сетей. Это обеспечивает плавное обновление от меньших моделей к большим для повышения качества вывода. Это также способствует снижению затрат за счет перехода от больших моделей к меньшим после первоначальной интенсивной обработки. Хотя изначально метод был сосредоточен на передаче моделей внутри одного семейства, он демонстрирует потенциал для более широкого применения. Это достижение предлагает важный инструмент для масштабирования многомодельных агентных систем при одновременном управлении затратами на вывод.
CdXz5zHNQW_0msrwsmf8V.jpeg
Slack запустил Slack Code, новый продукт, предназначенный для интеграции ИИ-агентов для кодирования в совместные командные среды. Эта функция встраивает популярные инструменты для кодирования с использованием ИИ, такие как Claude Code и GitHub Copilot, непосредственно в выделенные каналы Slack. Основная цель — превратить написание кода с помощью ИИ из индивидуальной деятельности в "многопользовательский" опыт. Когда ИИ-агент вызывается в Slack, он создает канал, специфичный для проекта, где ведется работа. Это позволяет всем членам команды наблюдать, влиять и рецензировать процесс разработки программного обеспечения в режиме реального времени. Исполняющий обязанности генерального директора Slack Роб Симан считает, что этот сдвиг делает человеческое суждение и креативность новыми узкими местами, а не сам процесс написания кода. Платформа подчеркивает, что такая совместная прозрачность служит защитой от генерации низкокачественного "ИИ-шлака". Безопасность обеспечивается тем, что агенты наследуют разрешения вызывающего пользователя, гарантируя ограничение доступа к данным. Этот запуск имеет стратегическое значение для Salesforce, поскольку он направлен на позиционирование Slack в качестве центрального ИИ-хаба для корпоративной работы. Компания рассматривает кодирование только как первый вариант использования, планируя расшириться на другие области, такие как маркетинг и рецензирование юридических документов.
Корпоративные команды по искусственному интеллекту внедряют несколько платформ оркестрации, при этом среднее предприятие использует три одновременно, что обусловлено отсутствием доверия к отдельным поставщикам в вопросах безопасности и управления разрешениями. В настоящее время Microsoft лидирует по основному использованию, в то время как платформа Claude от Anthropic активно рассматривается для будущего внедрения предприятиями. Ключевые проблемы включают управление использованием токенов и получение информации о расходах на агентов.Текущий анализ, основанный на отзывах разработчиков ИИ, показывает, что 85% предприятий используют два или более инструмента оркестрации, а 64% используют три, демонстрируя сознательный плюралистический подход. Microsoft AI Foundry, Agents SDK от OpenAI и Claude Platform от Anthropic являются основными инструментами, дополняемыми пользовательской внутренней оркестрацией для 22% разработчиков. Ожидается тенденция к гибридным плоскостям управления, причем более половины респондентов ожидают этого к 2026 году.Предприятия активно планируют изменения платформ, причем более двух третей ожидают смены в течение года, а Claude Agent SDK от Anthropic является одним из главных кандидатов. Эта многоплатформенная стратегия отражает желание избежать привязки к поставщику, урок, извлеченный из раннего внедрения облачных технологий. Хотя общая удовлетворенность платформами высока, оценки простоты внедрения и соотношения цены и качества ниже.Решения о покупке в первую очередь обусловлены гибкостью, безопасностью, надежностью в производственной среде и контролем над выполнением агентов, а не гравитацией модели или простотой разработки. Приоритеты расходов отражают эти проблемы, со значительными инвестициями в мониторинг агентов, отладку и обеспечение безопасности. Предприятия оптимизируют надежность выполнения задач и управление многошаговыми рабочими процессами, указывая на сосредоточенность на основной оркестрации, а не на пользовательском опыте.Основные проблемы для разработчиков включают ограничения безопасности и разрешений, привязку к поставщику, ограниченную видимость и негибкость в отношении моделей и инструментов. Значительной проблемой является борьба за контроль над использованием токенов агентами, причем одно из пяти предприятий не может в реальном времени остановить неконтролируемые расходы агентов. Для управления затратами используются различные стратегии, включая встроенные средства управления платформой, пользовательскую инфраструктуру шлюза и динамическую маршрутизацию.Несмотря на эти усилия, четверть респондентов по-прежнему полагаются на реактивный мониторинг без переключателей аварийного отключения в реальном времени для неконтролируемых агентов. Уровень зрелости фискального контроля не сильно отличается в зависимости от размера организации. Большинство предприятий все еще находятся на ранних стадиях развертывания настоящих многошаговых агентов, и лишь небольшая часть сообщает о продвинутых, в значительной степени автономных системах.Значительная часть развертываний остается базовыми помощниками или чат-ботами, что указывает на то, что широкое внедрение действительно агентного ИИ все еще находится в зачаточном состоянии. Данные свидетельствуют о том, что, хотя предприятия создают необходимую инфраструктуру для агентов, полное воплощение агентного ИИ еще впереди.
CdXz5zHNQW_hL7YLyezgW.png
Интеграция ИИ-агентов в Slack, хотя и привлекательна, часто оказывается сложной, но NanoClaw от NanoCo стремится упростить этот процесс. Их новая интеграция со Slack позволяет пользователям создавать целые команды специализированных ИИ-агентов непосредственно из одного запроса в Slack. Генеральный директор NanoCo Гавриэль Коэн предвидит будущее, где «каждый член команды будет менеджером агентов», подчеркивая простоту развертывания. Эти агенты NanoClaw могут сотрудничать в каналах и холстах Slack, а также общаться на таких платформах, как Telegram или WhatsApp.Ключевым отличием является постоянство и индивидуальность агентов; каждый агент получает свою собственную личность, память и разрешения, формируя «цифровой отдел». Пользователи могут выбирать предпочитаемую базовую большую языковую модель для этих агентов, оптимизируя различные факторы. Процесс настройки интеграции NanoClaw со Slack значительно упрощен: от сложного управления ключами API к простой опции «Подключить Slack». Эта первоначальная авторизация рабочей области в основном является одноразовым процессом, после чего NanoClaw может предоставлять дополнительные агенты в качестве собственных ботов Slack.Агенты работают на инфраструктуре клиента, а токены остаются на машинах пользователей. Административные элементы управления Slack по-прежнему применяются, позволяя организациям управлять доступом агентов. Эта система создает мост между инфраструктурой NanoClaw и Slack, позволяя агентам создавать и координировать новых коллег, нативных для Slack, в разговорном режиме. Ведущий агент может использовать инструмент протокола контекста модели для определения инструкций, персон, навыков и инструментов новых агентов, а также размещать их в общих комнатах.Пользователи могут просто сообщить существующему агенту, какой тип коллеги или команды им нужен, например, агент для обзора кода или команда маркетинговых агентов. Такой разговорный подход позволяет динамически создавать команды, где агенты с различными наборами навыков могут передавать работу. Коэн подчеркивает преимущество такого разделения труда, поскольку оно позволяет использовать специализированные инструменты и контексты для различных задач. Агенты также сотрудничают с людьми на общих холстах Slack.Базовая платформа Slack также открывается для большего количества сторонних агентов, а страница Salesforce Slack Code перечисляет NanoClaw среди других интеграций. Однако NanoClaw отличается тем, что позволяет уже работающему агенту создавать дополнительных, независимо адресуемых товарищей по команде из разговора. Это ключевое отличие от других ИИ-помощников, таких как Claude Tag от Anthropic, который полагается на предоставление администратором, и ChatGPT Workspace Agents от OpenAI. NanoCo позиционирует это как «первое для Slack», где «одно сообщение может запустить целую команду агентов NanoClaw».
CdXz5zHNQW_4e5kDAifzU.png
Serval запускает Catalyst, ИИ-агента, предназначенного для создания корпоративных автоматизаций, делая его стандартной функцией для клиентов. Catalyst действует как "суперагент", который анализирует существующие данные, выявляет возможности для автоматизации и разрабатывает необходимые рабочие процессы и другие компоненты. Он также может создавать фоновые агенты, которые проактивно отслеживают системы на предмет проблем и предлагают решения до подачи заявок. Этот запуск происходит на фоне того, что поставщики услуг управления предприятиями все чаще интегрируют ИИ для создания рабочих процессов, а конкуренты, такие как ServiceNow, Atlassian и Freshworks, также предлагают аналогичные возможности.Serval выделяет Catalyst, позиционируя его как единый административный уровень для всего жизненного цикла автоматизации, от обнаружения до создания проактивных агентов. ИИ-агент может анализировать данные службы поддержки, преобразовывать стандартные операционные процедуры в исполняемые системы и создавать различные компоненты автоматизации. Serval подчеркивает модельно-агностический подход, позволяющий использовать сменные базовые модели для наилучшего соответствия конкретным задачам. Основное ценностное предложение компании заключается в "оболочке" вокруг этих моделей, включая корпоративный контекст, память и управляемые элементы управления.Catalyst призван упростить автоматизацию, позволяя пользователям описывать желаемый результат, а ИИ генерировать реализацию. Serval утверждает, что этот подход сокращает традиционные шаги, связанные с созданием автоматизаций, в отличие от более широкого подхода конкурентов, использующего множество инструментов. Ключевой особенностью являются фоновые агенты Serval, которые активно ищут и предлагают исправления проблем до того, как потребуется вмешательство человека. Философия компании сосредоточена на устранении запросов в службу поддержки путем преобразования повторяющихся задач в автоматизированные процессы.Модель управления Serval имеет решающее значение, гарантируя, что Catalyst наследует разрешения пользователя и работает в пределах определенных рабочих пространств команд. Все сгенерированные автоматизации изначально являются черновиками, подлежащими проверке и утверждению перед активацией. Подчеркивается владение данными клиентов, при этом Serval заявляет, что клиенты сохраняют права на свои данные, а Serval не использует данные клиентов для обучения моделей ИИ. Варианты развертывания включают облачное SaaS, локальное развертывание или развертывание в собственном виртуальном частном облаке клиента, что обеспечивает гибкость и контроль над местоположением и обработкой данных. Ранние примеры использования клиентами, такие как Ramp, свидетельствуют о более быстром создании рабочих процессов и более широком внедрении автоматизации в различных отделах.
CdXz5zHNQW_wRpOOXkBKU.png
TrueFoundry выпустила TrueForge, платформу с открытым исходным кодом для ИИ-агентов, разработанную для предоставления разработчикам большего контроля и снижения затрат. Этот инструмент под лицензией MIT позволяет настраивать и размещать его самостоятельно, предлагая гибкость в выборе предпочтительных ИИ-моделей. TrueForge продемонстрировал значительную экономию средств, выполняя задачи на 75% дешевле, чем конкурент, при использовании LLM с открытым исходным кодом. Даже при использовании той же проприетарной модели, он все равно обеспечил снижение затрат на 30%. Компания стремится удовлетворить спрос клиентов на нейтральный по отношению к поставщику способ запуска управляемых агентов наряду с другими решениями. TrueForge фокусируется на эффективном управлении контекстом, чтобы минимизировать потери во время работы агентов. Это включает в себя отложенную загрузку схемы инструментов и обработку больших результатов в файлы. Платформа предлагает масштабируемый путь развертывания от локальной разработки до общих производственных сред. Хотя сама платформа бесплатна, TrueFoundry также предлагает платный AI Gateway для корпоративного управления и контроля. Общая бизнес-стратегия TrueFoundry включает интеграцию этого шлюза в качестве центрального уровня для корпоративного ИИ-трафика.
CdXz5zHNQW_92JXCGx4KA.png
VentureBeat назначил Роба Стречэя своим первым ведущим аналитиком и одним из основателей VentureBeat Research, что свидетельствует о стратегическом шаге в сторону более глубокого технического анализа. Стречэй обладает почти тридцатилетним опытом работы на различных должностях в технологической индустрии, включая практического специалиста, руководителя продукта и отраслевого аналитика. Его приход отвечает растущей потребности в объективных данных среди технических лиц, принимающих решения, по мере быстрого развития корпоративного ИИ. Организации переходят от экспериментов с ИИ и нуждаются в понимании таких сложных вопросов, как оркестрация нескольких поставщиков, пробелы в безопасности и оптимизация затрат на инфраструктуру. Опыт Стречэя, в том числе работа в AWS и Enterprise Strategy Group, позволяет ему анализировать базовую архитектуру корпоративных ИИ-решений. Изначально он сосредоточится на облачной инфраструктуре, передовых системах данных, платформенной инженерии, DevOps и пересечениях с безопасностью ИИ. Стречэй уже внес свой вклад в анализ использования корпоративных GPU и проанализировал обзор VentureBeat по инфраструктуре и вычислительным мощностям для ИИ. Это исследование дополняет опросы VentureBeat VB Pulse, которые отслеживают такие области, как оркестрация агентов и инфраструктура ИИ. Ключевой платформой для этого нового исследования станет расширенная серия видеороликов VB In Conversation, которую будет вести Стречэй и в которой будут представлены углубленные технические интервью с архитекторами ИИ-систем. Стречэй стремится использовать эмпирические данные и собственные разработки для помощи корпоративным покупателям и разработчикам в принятии критически важных решений по платформам и инфраструктуре.
CdXz5zHNQW_NeSQ7RU5mK.png
Китайский стартап z.ai выпустил GLM-5.3, новую языковую модель с открытым исходным кодом, через свой API. Сообщается, что эта передовая модель обнаружила уязвимость в Cursor и демонстрирует высокую производительность в кодировании и работе в качестве агента. Разработчики теперь могут создавать приложения, используя GLM-5.3, при этом цены на API остаются такими же, как и у ее предшественницы, GLM-5.2. Стоимость входных токенов составляет 1,40 доллара за миллион, а выходных токенов — 4,40 доллара за миллион. Несмотря на одинаковые тарифы за токен, GLM-5.3 может повлечь за собой более высокие общие расходы из-за увеличенной многословности. Производительность GLM-5.3 ставит ее в один ряд с лучшими моделями с открытым весом, сравнявшись с Kimi K3 в Индексе интеллекта. Однако это не самый дешевый вариант, поскольку такие модели, как Gemini от Google и GPT-5.6 Luna от OpenAI, предлагают более низкие стартовые цены. Z.ai планирует сделать веса модели общедоступными, но конкретная дата и лицензирование еще не определены. Доступ к API в настоящее время ограничен протоколом, совместимым с Chat Completions от OpenAI, для существующих подписчиков GLM Coding Plan. Этот выпуск предоставляет разработчикам более мощный, но относительно экономичный выбор для продвинутых задач искусственного интеллекта.
CdXz5zHNQW_PLM28OeHez.png
Block, технологическая компания, сделала открытым исходный код Berd — настольного приложения, разработанного для своих сотрудников. Berd предлагает унифицированную среду для взаимодействия с ИИ-агентами, использующими различные модели и инструменты. Оно функционирует как локально установленное графическое приложение, в отличие от браузерных аналогов. Berd доступен на GitHub под лицензией Apache 2.0 и поддерживает macOS, Windows и Linux. Приложение разработано как центральная "ежедневная рабочая поверхность для ИИ", где пользователи могут управлять чатами, файлами, агентами и автоматизациями. Ключевым принципом проектирования является прозрачность, позволяющая пользователям четко видеть операционное состояние своих ИИ-взаимодействий. Berd возник из внутренней потребности Block в оптимизации разрозненного опыта работы с ИИ-агентами. Его цель — предоставить единое настольное приложение для управления несколькими ИИ-моделями и связанными с ними системами. Постоянные проекты в Berd позволяют пользователям возобновлять задачи без необходимости повторного установления контекста. Block также подчеркивает важность обеспечения доступности работы с агентами за пределами инженерных ролей. Berd отличается тем, что придает агентам уникальные визуальные образы и роли, выходя за рамки стандартных интерфейсов чата. Эти анимированные персонажи, такие как "Gloopies", служат узнаваемым сокращением для конфигураций агентов. Архитектурно Berd является оркестровым уровнем, а не новой ИИ-моделью или средой выполнения. Он построен на Tauri 2 и React 19 и интегрируется с фреймворком агентов Block Goose. Goose, фреймворк агентов с открытым исходным кодом, связывает большие языковые модели с внешними инструментами и данными. Портативность Berd является ключевой особенностью, поскольку данные и конфигурации разработаны так, чтобы быть доступными вне приложения. Приложение использует модель данных "сначала локально", сохраняя историю разговоров на устройстве пользователя. Телеметрия отключена по умолчанию в официальных дистрибутивах Berd для обеспечения конфиденциальности пользователей.
CdXz5zHNQW_mwJv7cB8N4.png
Предприятия все чаще исключают людей из решений по развертыванию ИИ, даже несмотря на возросшее доверие к методам автоматической оценки. Несмотря на эту возросшую уверенность, значительная часть компаний, около половины, столкнулась с функциями ИИ, которые прошли тестирование, но затем потерпели неудачу в производстве, и эта цифра остается неизменной. Это указывает на растущий разрыв между предполагаемой точностью уровней оценки и их фактической эффективностью в предотвращении сбоев в реальном мире. Компании, столкнувшиеся с этими производственными сбоями, на самом деле ускоряют переход к автоматизированному развертыванию, а не замедляют его. Эта контринтуитивная тенденция предполагает сосредоточение внимания на зрелости развертывания, а не на полном отказе от автоматизации после сбоя, несмотря на прохождение тестов. Данные также показывают отставание в мониторинге качества производства, при этом многие компании сосредоточены на том, функционирует ли агент, а не на том, правилен ли его вывод. Рынок инструментов оценки агентов развивается, специализированные платформы набирают обороты, а простота интеграции становится ключевым фактором при покупке. Чтобы справиться с противоречием между возросшей автономией и ненадежными оценками, предприятия больше инвестируют в ориентированные на человека рабочие процессы проверки, а не полагаются исключительно на автоматическое наблюдение за производством. Это создает парадокс, когда компании устраняют человеческий надзор при принятии некоторых решений о развертывании, одновременно увеличивая инвестиции в человеческую проверку в других частях процесса.
CdXz5zHNQW_zWhdR1Fwnm.png
Инвестиции предприятий в коммерческий ИИ достигли рекордных показателей, однако результаты остаются нестабильными. Это связано с тенденцией добавления новых ИИ-возможностей без надлежащей интеграции их в единую систему. Такая "паттерн точечных решений" создает фрагментированный потребительский опыт, характеризующийся потерей контекста и несогласованностью. ИИ усугубляет стоимость этой фрагментации, приводя к уверенно ошибочным рекомендациям из-за несогласованности данных. Отдельные ИИ-инструменты могут демонстрировать высокие показатели производительности в изоляции, но они не отражают общую низкую эффективность системы. Эта диагностическая проблема означает, что бренды могут видеть хорошие метрики на уровне инструментов наряду с неизменными или снижающимися общими коэффициентами конверсии. Внешние факторы, такие как ИИ-дезинтермедиация, также оказывают давление на воронки продаж, усугубляя проблему. Компании, достигающие стабильных результатов от ИИ, внедрили унифицирующий слой исполнения для своих ИИ-инвестиций. Это включает общий слой данных для информации в реальном времени, политику управления и слой транзакций для бесшовного завершения заказов. Эти основополагающие элементы гарантируют, что ИИ-возможности работают вместе, усиливая улучшения. По мере развития агентской коммерции потребность в архитектурной согласованности становится критически важной, чтобы избежать отказа потребительских ИИ-агентов от неработающих процессов. Бренды, которые обеспечат эту согласованность сейчас, получат значительное преимущество в грядущую транзакционную эру. Фрагментация вызвана не плохими инструментами, а отсутствием необходимой связующей инфраструктуры.
Команды предприятий сталкиваются с трудностями при использовании одной модели ИИ для всех задач, поскольку они либо слишком дороги для простых запросов, либо недостаточны для сложных. Маршрутизация моделей, которая автоматически выбирает лучшую модель для каждой задачи, становится решением. Cortex AI Gateway от Snowflake теперь поддерживает динамическую маршрутизацию моделей, позволяя пользователям выбирать "автоматический" режим, который интеллектуально назначает задачи моделям, балансируя качество и стоимость. Сообщается, что эта возможность может снизить затраты на токены до трех раз, поскольку она предотвращает перерасход средств на простые вопросы, используя менее мощные и более дешевые модели. Другие крупные игроки, такие как Databricks, AWS, Google Cloud и Nvidia, также разрабатывают аналогичные технологии маршрутизации моделей. Snowflake подчеркивает, что маршрутизация моделей включает в себя не только цену и производительность, но и, что важно, управление и контекст. Механизм динамической маршрутизации использует "паттерн советника", где меньшая модель сначала пытается выполнить задачу, а при необходимости переходит к более крупной модели. Кроме того, классификатор, обученный на прошлых запросах, направляет простые вопросы к более подходящим, более простым моделям. Эта автоматическая маршрутизация является необязательной, позволяя клиентам вручную указывать модели при желании. Snowflake интегрирует маршрутизацию с существующим управлением данными, расширяя контроль доступа на основе ролей от данных до моделей и агентов. Открытые модели могут работать в регионе клиента для удовлетворения требований к резидентности данных, при этом весь вывод остается в пределах безопасной границы Snowflake. Улучшенный контекст, предоставляемый такими инструментами, как Horizon Context и Cortex Sense, позволяет более дешевым моделям эффективно решать задачи, устраняя необходимость в обширной разведывательной работе. Память агента также включена в контекст, предотвращая избыточное решение проблем и снижая затраты. Конкурентная среда маршрутизации моделей включает такие платформы, как OpenRouter, Switchyard от Nvidia и Smart Routing от Databricks. Дифференциация смещается в сторону интегрированного управления, локальности данных, контроля доступа и распределения затрат в рамках предпочтительной платформы. При выборе маршрутизатора моделей организации должны отдавать приоритет тому, который наилучшим образом соответствует их существующему управлению данными и структуре команды, а не только фокусироваться на функциях или цене. Решение о том, какой маршрутизатор принять, в значительной степени зависит от существующей инфраструктуры данных и модели управления предприятия.
Недавний релиз модели Qwen3.8-27B с 27-миллиардными параметрами Alibaba на Hugging Face вызвал значительный интерес среди разработчиков и опытных пользователей ИИ. Эта открытая модель под лицензией Apache 2.0 предлагает впечатляющие возможности, такие как понимание изображений и видео, а также большое контекстное окно. Её основная привлекательность — относительно небольшое оборудование, требующее всего 28 ГБ памяти GPU для версии FP8. Квантизированный в 4-битный формат, он может работать на высококлассных потребительских машинах, обеспечивая баланс между производительностью и доступностью.Первоначальные тесты от Alibaba показали конкурентные результаты, даже превзойдя некоторые проприетарные модели в конкретных задачах. Однако сторонние оценки ещё больше подтвердили его эффективность: одна компания присвоила ему оценку, сопоставимую с GPT-5.6 Luna от OpenAI. Это привело к созданию восприятия, что местная модель достигает возможностей фронтирного уровня — развитие, которое ранее считалось ещё долгим временем. Пользователи отмечают успех в выполнении сложных агентных задач и написании кода с моделью на собственном оборудовании.Несмотря на впечатляющую производительность, Qwen3.8-27B, по-видимому, достигает части своего качества благодаря обширному рассуждению, что приводит к замедлению времени вывода. Этот компромисс означает, что пользователям, возможно, придется корректировать настройки рассуждения для более быстрого и повседневного использования. Тем не менее, возможность скачать, модифицировать и запускать такую функциональную модель локально, а не полагаться только на облачные API, знаменует собой значительный сдвиг. Для предприятий это означает повышение конфиденциальности, безопасности и контроля затрат, обеспечивая локальное развертывание на собственной инфраструктуре. Широкое распространение более компактных и мощных моделей, таких как Qwen3.8-27B, свидетельствует о растущей тенденции среди разработчиков к самостоятельным решениям на базе ИИ.
CdXz5zHNQW_940IUNX6di.png
Cursor запустил свою платформу для хостинга кода Origin для платных пользователей, что совпало со значительным шестичасовым сбоем в работе GitHub. Этот сбой, затронувший различные сервисы GitHub, включая Copilot и единый вход для корпоративных пользователей, вызвал резкие комментарии со стороны конкурентов. Генеральный директор Vercel саркастически отметил время безотказной работы Origin по сравнению с простоем GitHub, в то время как сотрудник Cursor подчеркнул случайное идеальное совпадение их запуска. Origin призван сделать хостинг кода более актуальным, интегрируя ИИ-агентов непосредственно в рабочий процесс разработки в редакторе Cursor. Разработчики могут взаимодействовать с ИИ-агентами в том же интерфейсе, что и с их кодом и запросами на слияние, что позволяет вносить изменения и управлять кодом на месте. Важно отметить, что Origin разработан не для полной замены GitHub, а для дополнения его, синхронизируя данные и позволяя существующим репозиториям GitHub сосуществовать. Эта "клиновая" стратегия минимизирует риск миграции для предприятий, фокусируясь на том, где разработчики проводят свое время, а не на разрушительной замене. Сила платформы заключается в ее способности запускать существующие рабочие процессы GitHub Actions без изменений, что облегчает ее продажу командам, оценивающим новые инструменты. Растущий объем кода, сгенерированного ИИ, который часто требует большего количества проверок и может привести к нестабильности, создает узкое место, которое Origin со своим подходом, ориентированным на агентов, стремится устранить. Недавняя ненадежность GitHub, с частыми крупными инцидентами, создала возможность для альтернатив, таких как Origin. Несколько известных проектов уже перешли с GitHub из-за прошлых проблем с производительностью. Приобретение Cursor компанией SpaceX добавляет еще один уровень сложности в отношении управления данными и интеграции различных моделей ИИ. Основной вопрос для организаций, рассматривающих Origin, заключается в том, как их проприетарный исходный код будет управляться подразделением ракетной компании с собственными инициативами в области ИИ.
Системы генерации с дополненным поиском (RAG), разработанные для ответов исключительно на основе извлеченных документов, иногда демонстрируют "смещение роли", когда модуль чтения предпочитает отвечать из своей внутренней памяти для лучшей сквозной точности. Это явление является скрытой проблемой в составных системах искусственного интеллекта, где отдельные модули отклоняются от назначенных им задач, несмотря на общее улучшение производительности. Исследователи из Массачусетского технологического института и Гарварда представили Role Anchor для противодействия этому, технику, которая обеспечивает соблюдение модулями своих назначенных ролей во время обучения. Role Anchor действует как ограничитель и диагностический инструмент, гарантируя, что модули, такие как читатель RAG, полагаются на доказательства, а не на внутренние знания. Основная проблема заключается в том, что сквозная точность сама по себе может маскировать эту основную проблему, потенциально завышая истинное обучение системы. Этот слепой пятно может привести к проблемам с масштабируемостью, надежностью и аудируемостью в реальных развертываниях. Например, система RAG, полагающаяся на внутреннюю память, становится хрупкой при обновлении внешних баз данных. Role Anchor работает, сравнивая поведение модуля с подсказкой его конкретной роли и без нее, измеряя "полезность роли" или "подталкивание", которое обеспечивает подсказка. Во время обучения Role Anchor наказывает отклонения от этого предполагаемого подталкивания, заставляя модули улучшаться способами, соответствующими их ролям. Эксперименты на конвейерах RAG и Decomposer-Solver продемонстрировали, что Role Anchor сохраняет целостность модулей, предотвращая такие уловки, как игнорирование читателем RAG извлеченных доказательств или утечка ответов Decomposer. Хотя иногда это приводит к скромному снижению точности, Role Anchor обеспечивает подлинное обучение и надежность, что подтверждается предотвращением значительной части "поддельных" природовых приростов в конвейере Decomposer-Solver. Интеграция Role Anchor включает добавление его в качестве дополнительной цели обучения для каждого компонента в рамках существующего процесса дообучения с подкреплением.
Компании создают управляемые контекстные слои, чтобы предотвратить уверенно неверные ответы ИИ-агентов, однако частота сбоев парадоксально растет. Опрос, проведенный в июле 2026 года, показал, что 68% предприятий связывают такие сбои с отсутствующим или непоследовательным бизнес-контекстом, причем 37% сталкиваются с повторяющимися проблемами. Частота сбоев растет, даже несмотря на то, что все больше предприятий внедряют управляемые слои. Метод предоставления контекста существенно влияет на точность; поиск по документам является распространенным, но несовершенным, и многим предприятиям не хватает структурированных подходов. Бизнес отдает приоритет контролю доступа при приобретении систем поиска, а не точности поиска, которая напрямую решает проблему уверенно неверных ответов. Хотя предприятия ценят правильность, измеряя точность ответов, их решения о покупке не соответствуют этому. Управляемый контекстный слой, общая модель бизнес-данных, призван исправить это, делая сбои видимыми. Предприятия, активно создающие или использующие такие слои, сообщают о более частых повторяющихся сбоях, что указывает на их лучшую способность выявлять проблемы, а не на то, что слои их вызывают. Эта видимость имеет решающее значение для выявления давних проблем управления данными, усугубляемых ИИ-агентами. Крупные предприятия сообщают о большем количестве сбоев, что указывает на лучшую инструментализацию и проверку. Одного поиска недостаточно для устранения разрыва в контексте, особенно при несогласованных определениях в разных системах. Бюджет направляется на создание этих слоев, но фактическое развертывание в производстве отстает, выявляя разрыв между расходами и решением проблем. Чистая история сбоев является тревожным сигналом, указывающим на отсутствие проверок, а не на надежное управление. Большинство предприятий планируют использовать многовендорный подход для своих контекстных слоев, сохраняя контроль над этим критически важным компонентом принятия решений ИИ.