Как проверить, что AI действительно сокращает работу
AI может быстро подготовить черновик. Но рабочий результат появляется только после проверки, исправлений и принятия. Если учитывать лишь время генерации, можно принять перенос работы за её сокращение.
После выбора первого процесса возникает следующий вопрос: стало ли легче довести задачу до принятого результата с тем же качеством?
Что именно здесь исследуется
Это ограниченный обзор двух исследований и методологического обновления одного из них. Источники проверены 2 октября 2026 года. Выбор сделан для сопоставления разных рабочих контекстов, а не для оценки среднего эффекта AI во всех профессиях.
Данные ниже получены авторами источников. Собственный эксперимент здесь не проводился. Предложение для пилота — практический вывод из обзора, а не валидированная исследовательская методика.
Три наблюдения из первичных источников
Поддержка клиентов. В опубликованной в 2025 году работе Brynjolfsson, Li и Raymond изучалось поэтапное внедрение помощника среди 5 172 сотрудников поддержки. Число решённых обращений за час выросло в среднем на 15%; эффект различался по опыту работников. Это результат конкретного внедрения, а не обещание ускорения любой задачи. Generative AI at Work, QJE, опубликовано 4 февраля 2025 года.
Разработка в знакомых репозиториях. METR случайно распределяла 246 задач 16 опытных разработчиков между режимами с разрешённым AI и без него. В исследовании инструментов начала 2025 года задачи с AI заняли на 19% больше времени. После работы участники всё ещё оценивали помощь как ускорение. Авторы ограничивают результат этим контекстом. METR, 10 июля 2025 года.
Ограничения последующей оценки. В феврале 2026 года METR сообщила о проблемах нового эксперимента: участники и задачи отбирались иначе, а параллельная работа с агентами осложняла измерение времени. Авторы считают новую оценку ненадёжным сигналом текущего эффекта. Поэтому старое замедление нельзя выдавать за характеристику современных инструментов, а новую оценку — за точный размер ускорения. METR, 24 февраля 2026 года.
Почему нельзя усреднить эти результаты
В поддержке измеряли решённые обращения за час, в разработке — время выполнения задач. Различались люди, инструменты, требования к результату и способы внедрения. Знаки и проценты нельзя сложить в одну оценку «пользы AI».
Вывод этого обзора: выбирать инструмент по чужому проценту недостаточно. Нужно проверить конкретную связку «задача — человек — инструмент — критерий приёмки».
Что считать в своём пилоте
Сначала определите принятый результат. Для извлечения сведений из документа это могут быть заполненные поля с указанием места в источнике. Для черновика ответа — точность, полнота и пригодность к отправке после проверки человеком. Критерии должны быть одинаковыми для обоих режимов и записанными до измерения.
Затем учтите весь труд: подготовку входа, выполнение, проверку, исправления и ручное завершение неудачных попыток. Разделите активное время человека и календарное время до готовности. Если агент работает, пока человек делает другое дело, это разные показатели; их нельзя складывать как один вид затрат.
Наконец, отдельно считайте принятые результаты, возвраты и критические ошибки. Быстрая партия непригодных ответов не доказывает повышение продуктивности.
Как не испортить сравнение
Заранее выберите сопоставимые задачи и распределите их между режимами, вместо того чтобы отдавать AI только удобные примеры. Одну задачу не стоит последовательно делать самому и затем с AI: во второй попытке уже известен ответ.
Обучение инструменту и первичную настройку запишите отдельно. Если меняются модель, инструкция или правила проверки, начинайте новую серию и отмечайте версию. Не смешивайте улучшенную серию с исходной, чтобы получить красивое среднее.
Все попытки должны остаться в журнале, включая отказы и возврат к ручной работе. При небольшом числе наблюдений результат — сигнал для следующего эксперимента, а не универсальный эффект или статистически доказанная экономия.
Когда продолжать
До старта согласуйте, какое сокращение трудозатрат имеет смысл именно для вашего процесса, какое качество обязательно и какая ошибка требует остановки. Единого порога для всех задач здесь нет.
Продолжать разумно, когда сопоставимые принятые результаты требуют меньше человеческого труда, качество сохраняется, а настройка и обслуживание не съедают выигрыш. Если процесс ускорился только за счёт пропущенной проверки, цель не достигнута.
Практическое продолжение — шаблон проверки AI-пилота.
Ограничения
Обзор не охватывает всю литературу и не определяет лучшие модели на октябрь 2026 года. Он не доказывает эффект для Pro-leads, Tender Audit или проектов автора. Протокол ниже нужно приспособить к задаче; для серьёзных решений маленькой пробной партии недостаточно.