Исследования

Показатели агентских решений для рабочих мест показывают, что история корпоративного ИИ выходит за пределы демонстраций

Новый взгляд на эталоны агентов на рабочем месте показывает, что выполнение задач и безопасность улучшаются одновременно. Это важно, потому что внедрение корпоративного ИИ зависит от надежной передачи задач, аудита и меньшего количества необратимых ошибок.

Автор: Лео В ·

Показатели агентских решений для рабочих мест показывают, что история корпоративного ИИ выходит за пределы демонстраций
Mantis.

The workplace-agent история уходит от демонстраций, потому что ориентиры начинают измерять то, чего на самом деле боятся предприятия: не только выполнит ли агент задачу, но и причинит ли он сопутствующий ущерб по пути. Недавний пересмотр WorkBench сообщает о больших успехах в выполнении задач и резком снижении непреднамеренно вредных действий.

Это сочетание имеет значение. Покупатели корпоративного уровня всегда скептически относились к агентам, которые выглядят блестяще в контролируемой демонстрации, но отправляют неправильное письмо, удаляют неправильный файл или действуют вне намерений пользователя. Рынок агентов будет завоеван системами, которые могут завершать работу и совершать меньше дорогостоящих ошибок.

Безопасность и возможности сходятся

Наиболее интересным сигналом является то, что возможности и безопасность могут улучшаться вместе в структурированные офисные задачи. Лучшие модели понимают context, инструкции, инструменты и последствия более надежно. Это может снизить как вероятность невыполнения задачи, так и случайных побочных эффектов, которые вызывают беспокойство у менеджеров.

Корпоративным агентам нужны контрольные точки утверждения и ручные передачи, а не только автономное выполнение задач. Изображение: Mantis.
Корпоративным агентам нужны контрольные точки утверждения и ручные передачи, а не только автономное выполнение задач. Изображение: Mantis.

Но оставшиеся ошибки имеют значение именно потому, что они обычные. Отправка электронной почты не тому получателю или внесение необратимых изменений — это не риск из научной фантастики. Это повседневный операционный риск, который определяет, разрешает ли компания агентам работать с реальными рабочими процессами.

Аудиторские следы становятся функциями продукта

Внедрение в корпоративном сегменте будет зависеть от аудиторские следы, permissions, варианты отката и чёткие сводки с обоснованием. Менеджеру нужно знать не только то, что агент выполнил задачу. Ему необходимо знать, какие данные он использовал, какие действия совершил, что пропустил и когда человек одобрил передачу.

Надёжный интерфейс между предприятием и агентом может быть журналом аудита так же, как и окном чата. Изображение: Mantis.
Надёжный интерфейс между предприятием и агентом может быть журналом аудита так же, как и окном чата. Изображение: Mantis.

Бенчмарк также переосмысливает ценообразование. Если модели с открытой весовой схемой могут дешево выполнять многие офисные задачи, в то время как передовые системы остаются сильнее при работе со сложными процессами, предприятия могут распределять работу агентов по уровню риска: дешевые модели для задач с низким риском, премиальные модели для решений с высокими ставками.

Темы: агенты ИИ, WorkBench, корпоративный ИИ, безопасность ИИ

Канонический адрес статьи