Мы не измеряем экономический эффект от внедрения ИИ

На каждой второй IT-конференции есть доклад о том, как посчитать экономический эффект от внедрения ИИ в разработку и в процессы компании в целом. ROI, окупаемость, time-to-market - самая горячая тема сезона. Мы в Цельсе решили не делать ничего из этого. Мы не строим формальную модель экономического эффекта от ИИ - не считаем ROI, не пытаемся измерить вклад агентов в TTM и не переводим сэкономленное время в деньги.

Дисклеймер - я не утверждаю, что эффект невозможно измерить или что измерения всегда бесполезны. Я лишь говорю, что у самого замера тоже есть стоимость, и она точно так же должна окупаться. И вообще настоящий заголовок поста должен быть что-то в духе “При текущем масштабе и стоимости ИИ-инструментов мы решили не строить формальную модель ROI”. Но это слишком длинно и скучно.

Из точных измерений мы сейчас смотрим только на adoption и паттерны использования. Через встроенную телеметрию клиента мы кладём метрики в Prometheus, события в ELK, трейсы в Langfuse. Так мы понимаем, кто насколько активно использует ИИ-агентов, какие MCP-инструменты наиболее востребованы, какие ошибки возникают.

По этим данным мы принимаем скучные, но важные решения - кому помочь с настройкой, кому купить premium-место, какие инструменты добавить в общий MCP. Всё это увеличивает удобство, уровень и эффективность использования, но мы не знаем, сколько дополнительных фичей мы успели выкатить или сколько денег дополнительно заработали благодаря ИИ-агентам. Это основной минус adoption-метрик - даже если все используют ИИ, это может означать, что инструмент навязали, что люди экспериментируют, но без пользы, или что мы вообще наносим вред, увеличивая техдолг через генерацию ИИ-слопа.

Почему мы решили отказаться от замеров? Экономический эффект нельзя измерить количеством коммитов или строчек кода, написанных ИИ-агентом. Как минимум нужно:

  • Выбрать бизнес-метрики с приемлемым лагом и при этом не слишком высокоуровневые (чтобы на них не влияло слишком много других факторов)
  • Установить бейзлайн - нужно каким-то образом получить срез метрик до внедрения ИИ. Если в компании уже снимается срез нужных метрик - отлично, но далеко не во всех небольших компаниях это делается
  • Придумать экспериментальный дизайн - нужно придумать, как более-менее честно сравнить режимы “без ИИ” и “с ИИ”. В идеале нужна релевантная контрольная группа, способ минимизации влияния других факторов, возможно, какой-то diff-in-diff дизайн. У каждого подхода есть плюсы и минусы, а ещё всеми этими замерами и их анализом должен кто-то заниматься
  • Честно посчитать затраты - не только подписки, токены и железо, но и время на поддержку тулинга, обучение сотрудников

Всё это не задачка на вечер и не один дашборд, а, скорее всего, отдельный многомесячный проект - даже в небольшой компании. И затраты на это измерение в итоге могут сильно превысить затраты на само внедрение - скажем, сейчас мы тратим не более тысячи долларов на подписки плюс время на поддержку тулинга. Как компания из сферы медицинского ИИ, мы очень хорошо знаем, сколько может стоить честная валидация качества работы ИИ…

Чем точнее измерение - тем больше затраты. Линейка стоит дешевле лазерного дальномера. И лично мне сейчас не нужен точный измерительный инструмент, чтобы сделать вывод, что текущие затраты окупаются с большим запасом, и этот эффект будет расти. Можно сказать, что мы не отказались от измерений, а заменили их на грубую оценку на основе наблюдаемых изменений. Примеры таких “измерений”:

  • Разработчиков теперь дёргают значительно реже - ИИ-бот в Маттермосте отвечает на большую часть вопросов менеджеров (“сколько исследований за июль обработали у такого-то клиента”, “почему не обработалось это исследование”, “как в коде устроен алгоритм выбора серии”)
  • Скорость доезда небольших фичей и хот-фиксов до продакшна выросла многократно - ускоряется не только этап написания кода, но и этап поиска корневой причины проблемы
  • Время анализа инцидентов в большинстве случаев сократилось до нескольких минут
  • Нет явных негативных сигналов - роста количества инцидентов или откатов релизов

ИИ-бот в Маттермосте разбирает логику бэкенда по вопросу из треда

В общем, визуальных свидетельств для меня достаточно, чтоб продолжать вкладываться во внедрение ИИ в разработку и не только. И недостаточно, чтобы говорить о подтверждённом экономическом эффекте. Разница между этими двумя утверждениями - это и есть цена, которую мы решили не платить. Я лучше вложу лишний час в добавление новых тулзов или улучшение памяти агента (что он знает о нашей компании).

Заканчиваю рейджбейтить и поговорю немного о том, почему такое решение, очевидно, подходит далеко не всем:

  • Чем о больших бюджетах идёт речь, тем больше риски. Одно дело купить 25 подписок, другое дело тратить десятки тысяч долларов на API-токены или на локальный деплой Kimi K3
  • Если вы распределяете бюджет в большой компании между десятками инициатив, очевидно, нужен способ сравнить их между собой и с бейзлайном
  • Чем больше уровней иерархии между платящим и применяющим инструмент, тем больше вероятность, что с вас потребуют какие-то доказательства эффекта
  • Если у вас и так всё обложено метриками, то измерение эффекта будет дешевле
  • Если вы внедряете ИИ в процессы с большими рисками - общение с клиентами, юридический отдел, найм

Итог такой: отказ от измерения экономического эффекта от внедрения ИИ-инструментов - это очередное менеджерское решение. Всё зависит от затрат, рисков, контекста, размера компании, вашей позиции в этой компании. На какие решения повлияют полученные метрики, окупится ли само измерение, насколько сложно будет получить честные метрики? Ответы на эти вопросы и определят, хватит ли вам нашего подхода.

Поэтому наш заочный спор с Костей не о том, существует ли экономический эффект и можно ли перепутать adoption с пользой. Конечно, можно. Спор, скорее, о необходимом уровне доказательности. Чем выше бюджет, цена ошибки и стоимость отката, тем дороже незнание и тем больше нужно измерять. Чем решение дешевле и обратимее, тем выше вероятность, что формальная оценка эффекта окажется дороже самой ошибки.

Ещё один важный дисклеймер - всё это не отменяет того, что внедрять можно хорошо и плохо. Можно раздать всем подписки, никому не помогать, никого не обучать, не разрабатывать общий удобный и безопасный тулинг. И тогда измеряй, не измеряй - вряд ли получится хорошо. Ну или по крайней мере не так хорошо, как могло бы быть.

Ну и последнее, субъективное. На мой взгляд, не вкладываться сейчас во внедрение ИИ - это самоубийство. Лучше наделать ошибок и продраться сквозь проблемы, но начать проходить этот путь прямо сейчас. И это верно на всех уровнях - компании, команды, личном.