ИИ-агент в оргсхеме: эффект горячей картошки

10 мин чтения
Stanislav Belyaev
Stanislav Belyaev Engineering Leader в Microsoft
ИИ-агент в оргсхеме: эффект горячей картошки

Представьте: ИИ подготовил бюджетный документ, вы просмотрели его и попросили коллегу проверить ещё раз. В корпоративной системе осталось подтверждение, что документ видели двое. Только первый проверяющий нашёл меньше ошибок, а работу второго исследователи вообще не наблюдали.

Именно такой результат получили Эмма Уайлс, Меган Сюй, Джули Бедард и Мэттью Кропп в рабочей статье о месте ИИ в оргсхеме. Среди менеджеров из компаний, где агенты уже значатся в организационных схемах, участники на 22 процентных пункта чаще просили о дополнительной проверке, которая могла стоить им вознаграждения, когда автора представляли как «ИИ-сотрудника», чем когда его представляли безымянным ИИ-инструментом. При базовой доле 50% это рост на 44%.

Одновременно эти менеджеры приписывали себе на 9 процентных пунктов меньше ответственности, а «системе ИИ» – на 8 процентных пунктов больше. Авторы называют сочетание слабой личной проверки, передачи работы дальше и смещения ответственности эффектом горячей картошки.

Звучит знакомо: формально проверяющих стало больше. Кто в итоге отвечает за весь документ и готов его подписать?

Пять документов и одно изменённое слово

В эксперименте участвовали менеджеры, директора и руководители по персоналу и финансам, которых набрали через профессиональную экспертную сеть. Сначала регистрационный опрос прошёл 1 261 человек. Через неделю до эксперимента дошли 857 участников, а после отсева тех, кто не прошёл проверку внимательности, в итоговой выборке осталось 813.

В регистрационном опросе 23% респондентов сообщили, что агенты уже значатся в организационной схеме или схеме процессов их компании. Ещё 31% сказали, что руководство подаёт ИИ как сотрудника или члена команды; это две разные характеристики, хотя в публичных пересказах их легко склеить.

Поэтому формулировка «эксперимент на 1 261 менеджере» завышает выборку. Кроме того, это образованные специалисты довольно высокого уровня, которые работают с персоналом или финансами и добровольно пришли через экспертную сеть. Для разговора о менеджерах выборка подходит, но переносить выводы на всех работников или все компании уже нельзя.

Задача была конкретной. Участники получали пять документов с заранее внесёнными ошибками и 20 минут, чтобы проверить столько, сколько успеют: специалисты по персоналу разбирали описания вакансий, финансисты – бюджетные документы. В окне проверки можно было выделять текст, ставить пометки и писать комментарии.

Менялось только описание автора:

  • В условии «ИИ-инструмент» менеджеру говорили, что он воспользовался генеративным ИИ без имени.
  • В условии «ИИ-сотрудник» документы подготовил ALEX-3, полгода назад назначенный прямым подчинённым и внесённый в оргсхему отдела.
  • В условии «сотрудник-человек» автором был Alex – тоже прямой подчинённый, назначенный полгода назад и тоже внесённый в оргсхему отдела. Про него добавляли, что он пришёл с похожей должности в другой компании.

Сами документы совпадали. Различие в поведении нельзя объяснить более удачным текстом одной из систем: все видели одни ошибки и располагали одним временем.

Где возникла горячая картошка

В полной выборке участники почти одинаково находили ошибки; статистически значимого изменения качества проверки и надзора в среднем авторы не нашли. Заметный разрыв возник среди менеджеров, чьи компании уже внесли агентов в организационные или рабочие схемы, – о таком положении дел сообщили 23% участников.

Среди этих менеджеров F1 проверки был на 5,3 процентного пункта ниже, когда автора представляли как «ИИ-сотрудника», чем когда его называли «ИИ-инструментом». F1 сводит в одну оценку полноту обнаружения настоящих ошибок и точность пометок; при базовом уровне 0,41 такое снижение соответствует примерно 13%.

Отдельно доля найденных ошибок упала на 5,8 процентного пункта. Относительно базового уровня это снижение на 17%. Популярной цифры «18% меньше ошибок» в тексте работы нет.

Затем участник решал, звать ли ещё одного проверяющего. Просьба имела цену: за оправданную просьбу при низкой полноте давали дополнительные билеты в розыгрыше, за лишнюю проверку при высокой полноте билеты снимали. Без такой цены второго проверяющего просили почти все, и сравнивать условия было не на чем.

Когда за лишнюю проверку приходилось расплачиваться билетами, группы повели себя по-разному. Менеджеры в условии «ИИ-сотрудник» сами проверяли слабее и на 22 процентных пункта чаще просили передать документ следующему человеку, хотя это могло стоить им билетов. Можно ли считать вторую проверку разумной компенсацией? Возможно. Данных о ней у исследователей нет.

Разница возникает в момент приёмки: менеджер должен сам найти ошибку, понять, насколько уверен в проверке, и решить, готов ли подписать документ. Именно этот навык стоит отработать на собственных рабочих задачах, пока должность агента не стала поводом ослабить проверку.

Научитесь проверять работу ИИ и решать, что готовы подписать: 9 задач менеджера, бесплатный доступ и разбор результата.

Доступ сразу после регистрации

Начать обучение

Alex против ALEX-3

Работу подчинённого менеджер проверяет иначе, чем ответ собственного инструмента. Возможно, дело в обычном делегировании.

Сравнение с сотрудником-человеком помогает проверить эту версию. В той же подгруппе F1 при работе с ALEX-3 оказался на 6,8 процентного пункта ниже, чем при работе с Alex. Запросы на дополнительную проверку выросли на 25 процентных пунктов, а доля ответственности, которую менеджер оставлял себе, снизилась на 9 процентных пунктов.

Сравнение трёх условий эксперимента: результаты для безымянного ИИ-инструмента значимо не отличались от результатов для сотрудника-человека; при работе с «ALEX-3, вашим ИИ-сотрудником» F1 проверки был на 6,8 процентного пункта ниже, а документ просили передать дальше на 25 процентных пунктов чаще; документы сотрудника Alex проверяли внимательнее всего.
Мы построили схему по числам, которые авторы приводят в тексте и приложении рабочей статьи. Иллюстрации самой статьи не воспроизводятся.

Менеджеры внимательнее всего проверяли документы сотрудника-человека. По словам авторов, когда автором называют человека или машину, руководители ведут себя противоположным образом. Машине дали должность, имя и прямого руководителя, однако вести себя с ней как с обычным подчинённым менеджеры не стали.

Почему человек вызывает больше внимания: из-за ожидания обратной связи, оценки его усилий или будущей совместной работы? Эксперимент разделить эти объяснения не позволяет. Я сначала прочитал результат как «имя ALEX-3 портит контроль». Но различие заметно только там, где компания уже закрепила статус ИИ-сотрудника.

Личная привычка проверять ответы всё равно нужна. В статье о задачах, которые нельзя отдавать ИИ целиком решение остаётся за менеджером; здесь исследование показывает, как оргсхема может незаметно ослабить эту привычку. Одного призыва «будьте внимательнее» здесь мало: менеджеру нужен воспроизводимый способ приёмки.

Имя ничего не купило

Очеловечивание агента можно было бы оправдать, если бы после этого менеджеры охотнее внедряли ИИ. Исследователи проверили намерение внедрять ИИ, готовность тратить время на обучение, интерес к росту производительности и тревогу за своё рабочее место. Различий между условиями не обнаружили.

Имя, должность и место в оргсхеме повлияли на проверку в чувствительной подгруппе, но не изменили измеримо то отношение к ИИ, ради которого компании обычно говорят о «цифровых сотрудниках» и «членах команды».

У нулевого результата есть предел. Выборка изначально была крайне лояльна к ИИ: в группе сравнения, где ИИ описывали как безымянный инструмент и агенты в оргсхеме не значились, около 90% участников сообщали об интересе, желании учиться и намерении внедрять инструменты, тогда как за рабочее место беспокоились лишь 20%. Из-за высоких исходных оценок рост было трудно обнаружить.

Отдельно 57% участников говорили, что готовы руководить ИИ-сотрудником. Появление агента в оргсхеме спокойно воспринимали 33%, а среди тех, у кого такие агенты уже внесены в схемы, доля была выше на 9 процентных пунктов. Работать с агентом готовы многие, но тщательнее проверять его работу от этого не начинают.

То, как представили автора документа, влияет на действия менеджера, хотя на словах отношение к ИИ остаётся прежним. При работе с несколькими агентами возникает похожая проблема: делегирование требует заранее заданных ролей и критериев приёмки, иначе менеджер получает цепочку выполненных операций без ясного владельца итогового решения.

В открытом модуле можно применить этот вывод к собственным задачам: выбрать роль для ИИ, задать критерий сдачи и встроить проверку в рабочий день, чтобы было понятно, кто отвечает за результат.

Пройдите открытый модуль и соберите рабочую схему с ИИ: роль, критерий сдачи и проверка результата на ваших задачах.

Доступ сразу после регистрации

Начать обучение

Пять ограничений исследования

Этой работе легко приписать более широкий вывод, чем позволяют данные.

  • Для всей выборки исследователи не нашли заметного ухудшения проверки. Все значимые цифры – снижение F1, полноты, личной ответственности и рост запросов – относятся к подгруппе компаний, где агенты уже были в оргсхеме.
  • Сравнение компаний по наличию агента в оргсхеме авторы заранее не планировали. В плане анализа они указали другой признак: считает ли менеджер, что руководство компании представляет ИИ как сотрудника. По этому признаку результаты получились похожими, но оценка была неточной. Авторы пишут о замене в тексте и приложении, и всё же ключевую подгруппу выбрали уже после того, как план был написан.
  • Эксперимент завершили 813 человек, а нужная подгруппа – это 23% из них. Исходные 1 261 участник относятся к регистрационному опросу. Вывод касается руководителей по персоналу и финансам, пришедших через экспертную сеть.
  • Исследователи видели просьбу о дополнительной проверке, затем наблюдение заканчивалось. Они не знают, состоялась ли проверка, сколько ошибок нашёл коллега и каким вышел итоговый документ. Сказать, стало ли в готовом документе больше ошибок, нельзя.
  • Трое из четырёх авторов работают в BCG, которая продаёт консультации по операционным моделям ИИ. В пользу исследователей говорят предрегистрация в AEA RCT Registry, рассмотрение этическим комитетом Бостонского университета по протоколу 8254X, открытый препринт и опубликованные нулевые результаты. Ни одно из этих обстоятельств не отменяет того, что вывод о незаметном ослаблении контроля коммерчески удобен компании.

Есть ещё вопрос без ответа: повторится ли эффект в реальной компании, где менеджер знает историю конкретного агента, видит прошлые ошибки и рискует настоящим бюджетом? Здесь менеджеры работали в условиях эксперимента, и на проверку у них было 20 минут.

Ответственность нужно записать

Авторы также провели отдельный июньский опрос. Его прошли 1 500 руководителей в США, а ответы взвесили по отраслям, поэтому по нему проще судить о распространённости практик на рынке, чем по основной выборке. Агентов внедрили в системы или процессы 53% опрошенных. Треть опрошенных сообщила, что их компании внедрили агентов и хотя бы одним способом закрепили их роль.

Имя агенту давали чаще, чем назначали человека, который отвечает за его результат: 17% против 13%.

Столбчатая диаграмма по ИИ-агентам: в процессы их внедрили 53% компаний, как-то закрепили их роль 33%, дали имя или личность 17%, должность 14%, внесли в оргсхему 14%, назначили ответственного человека 13%, называют «ИИ-сотрудниками» 11%.
Мы построили диаграмму по числам, которые авторы приводят для июньского опроса 1 500 руководителей. Иллюстрации рабочей статьи не воспроизводятся.

Авторы не проверяли, помогут ли предложенные меры, но по результатам исследования рекомендуют три шага организациям, которые закрепляют роль агентов.

Закрепите одного ответственного человека за каждым агентом. В карточке процесса должно быть имя того, кто принимает результат, может остановить выпуск и отвечает за ошибку после всех автоматических шагов. По формулировке «владелец – команда» не понять, кто именно отвечает за ошибку. Эксперимент показал, как в такой ситуации менеджеры перекладывают ответственность на других.

Здесь нужна фамилия. «Владелец финансового агента» звучит солидно, однако при сбое сотруднику всё равно придётся открыть исходные данные, принять решение о выпуске и объяснить его руководителю. Поэтому в отчёте, заявке, прогнозе или письме клиенту должно быть указано, кто отвечает за результат: реестр агентов, доступный только администраторам, задачу не решает.

Для задач, в которых ошибка дорого обойдётся, установите обязательные проверки. Для бюджетного документа это может быть сверка сумм с первичными данными, проверка формул и выборочная перепроверка предположений, на которых построен расчёт; для описания вакансии – требования закона, диапазон оплаты и фактические обязанности. Применяйте одни и те же проверки к тексту человека, безымянного инструмента и агента с должностью.

Обязательные проверки лучше описывать конкретными действиями. После выпуска нельзя подтвердить, что документ «проверили внимательно», зато в нём остаются ссылки на исходные таблицы, отмеченные расхождения и имя подписавшего. Проверка зависит от цены ошибки: внутренний черновик можно просмотреть выборочно, а документ для платежа нужно проверить полностью по установленной процедуре независимо от уверенности автора.

Здесь полезен журнал исправлений для правдоподобного отчёта ИИ: менеджер записывает источник ошибки, исправление и правило следующей проверки. Так остаётся запись о проверке, а в дальнейшем её можно проводить быстрее. Память о том, что «ALEX-3 обычно справляется», такой записи не оставляет.

Заранее укажите, у кого остаётся ответственность после передачи. Просьба коллеге посмотреть документ может улучшить решение. В процедуре всё равно нужна строка: кто собирает замечания, кто разрешает разногласия и чья подпись означает выпуск. Дополнительный рецензент помогает заметить ошибки, но ответственность автоматически к нему не переходит.

Полезно различать запрос совета и передачу решения. В первом случае коллега отмечает риск, затем исходный владелец принимает или отклоняет замечание и фиксирует причину; во втором новый владелец прямо принимает результат и получает полномочия остановить процесс. Серая формулировка «посмотри ещё ты» удобна ровно до первой ошибки, после которой каждый участник помнит свою роль немного иначе.

Для регулярного процесса достаточно короткой карточки: какой результат выпускает агент, кто его принимает, какие проверки нельзя пропускать, когда нужен дополнительный эксперт и кто подписывает готовую версию. Карточка особенно полезна, когда что-то идёт не по плану. Если ответственный в отпуске, модель обновилась или источник данных недоступен, команда заранее видит, кто может принять решение и при каких условиях работа должна остановиться.

Это рекомендации авторов, выведенные из наблюдаемого поведения. Эксперимент не сравнивал команды с такими правилами и без них, поэтому обещать, что три меры устранят эффект, рано. Какой минимум проверки окажется достаточным для разных классов решений? Пока неизвестно.

Другое исследование показало, как структура вокруг модели делает ответ надёжнее. А если агента внесли в оргсхему до того, как назначили ответственного человека, установили стандарт приёмки и указали, кто подписывает результат, проверка может ослабнуть.

Оргсхема ничего не проверяет. Документ проверяет человек по установленной процедуре и понимает, что после передачи коллеге его доля ответственности не уменьшится.

Специализация

Встройте ИИ в рабочий день с понятной ответственностью

В «Фундаменте» вы учитесь ставить задачи ИИ, проверять результат и собирать повторяемый процесс, где заранее ясно, что можно делегировать и что остаётся за менеджером.

От pre-mortem до антикризисного плана
Переиспользуемые промпт-шаблоны
Сквозной кейс на реальном проекте
~300 часов экономии в год

Часто задаваемые вопросы

Правда ли, что менеджеры делают на 18% больше ошибок с ИИ-сотрудником?
Нет, такой цифры в рабочей статье нет. Среди менеджеров из компаний, где агенты уже внесены в оргсхему, участники нашли на 17% меньше заранее внесённых ошибок, а оценка качества проверки по F1 снизилась примерно на 13% по сравнению с условием с безымянным ИИ-инструментом. По всей выборке заметного ухудшения проверки исследователи не нашли.
Ухудшает ли ИИ-агент качество готового документа?
Исследование не отвечает на этот вопрос. Авторы видели первую проверку менеджера и его решение попросить коллегу посмотреть документ ещё раз, после чего наблюдение заканчивалось. Они не знают, состоялась ли вторая проверка, сколько ошибок нашёл коллега и сколько их осталось в готовой версии. Поэтому вывод об итоговом качестве сделать нельзя.
Кто отвечает за документ, который подготовил ИИ-агент?
Назначьте человека, который принимает результат и решает, можно ли его выпускать. Для документов с высокой ценой ошибки заранее запишите обязательные проверки и укажите, чья подпись означает выпуск после замечаний коллег. Это рекомендации авторов, выведенные из результатов эксперимента; отдельно их не проверяли.
Stanislav Belyaev

Stanislav Belyaev

Engineering Leader в Microsoft

18 лет в управлении инженерными командами. Основатель mysummit.school. 700+ выпускников в Яндекс Практикуме и Стратоплане.