Когда результатов стало слишком много
Результатов в разы больше, а быстрее ничего не поехало: проверять стало дороже, чем создавать
Организации, куда дошли языковые модели, нередко видят похожую картину: производство рабочего артефакта — договора, регламента, отчёта, руководства по эксплуатации, презентации, макета — подешевело в разы, а организационный цикл сократился далеко не пропорционально. У отдельного человека прирост очевиден и измерим. На уровне организации он куда-то девается по дороге.
Общее место, которым обосновывают парадокс AI апологеты — люди пока не освоили инструмент, дайте им год. Оно отчасти верное: у любой технологии есть своя J-кривая, когда выигрыш приходит только после того, как под неё переложены процессы. Но, на мой взгляд, работает и вторая причина, обучением она не лечится. Производство и основание доверять результату были склеены в одном человеке и в одном отрезке времени: тот, кто писал документ, тем же трудом зарабатывал право на доверие к нему. Он думал, сверялся, перебирал и отбрасывал варианты, и на выходе документ нёс на себе следы этой работы. Генеративные модели эти две вещи расклеили: артефакт производится за минуты, а доказательство того, почему ему следует верить, внятно не предоставляется.
Дальше мои измышления о том, из чего это доказательство складывалось само, почему оно перестало складываться и что теперь делать.
Дорогое производство работало доказательством
Объём был честным сигналом вложенного времени ровно до тех пор, пока подделать его стоило столько же, сколько сделать работу
Есть привычка, которую мало кто формулировал вслух, но на неё опиралось управление умственным трудом: объём был честным сигналом вложенного времени. Сорокастраничная записка означала, что человек потратил недели, и уже поэтому заслуживала внимания. Мы читали не только содержание, мы читали свидетельство труда, зашитое в саму толщину документа, — и сигнал не врал, потому что подделать его стоило примерно столько же, сколько сделать работу по-настоящему.
Нормоконтроль в проектировании, государственная экспертиза, входной контроль, выборочная приёмка решают разные задачи, но выросли в одних и тех же условиях: пропускная способность проверки ограничена, поэтому её приходится распределять.
Ответственность держится там же. Формула «ответственное лицо проверяет и подписывает» несёт в себе молчаливое допущение, что объём физически прочитываем, а подпись работает свидетельством того, что человек действительно смотрел и согласен с изложенным.
Но что-то изменилось. Толщина документа больше ничего не значит, верим ли мы ей по-прежнему? На планёрке в понедельник руководитель отдела докладывает, что за неделю сдали регламент, два отчёта и техзадание на сорок страниц, все кивают. А кто-то спрашивает, прочитал ли эти сорок страниц хоть один человек, способный подтвердить, что там написана правда? На заводе такую гору результатов называют незавершённым производством, и там её видит каждый: она занимает площадь, мешает ходить и раздражает начальника участка. На общем диске она выглядит как продуктивная неделя.
Из результата исчезло намерение
Передаётся результат, а не намерение, и принимающий достраивает его за свой счёт
Между людьми передаётся результат, но не намерение. Текст, чертёж, макет или таблица содержат то, что получилось, и не содержат того, зачем это делалось, какие варианты автор перебрал и отбросил, где он сомневался, а где знал точно. Принимающий вынужден намерение реконструировать, и у этой реконструкции есть цена, которой нет у собственного производства.
Это не значит, что проверить всегда дороже, чем сделать: короткий расчёт быстрее прочитать, чем выполнить, типовой договор быстрее вычитать, чем составить с нуля. Но у приёмки есть фиксированная надбавка на восстановление контекста, и пока производство было дорогим, она терялась на его фоне. Как только генерация подешевела, надбавка стала главной статьёй затрат.
Разница гасилась ещё двумя вещами. Объёмом: человек писал столько, сколько успевал, и на выходе получался документ, соразмерный вниманию одного читателя. И наличием автора: у него можно было спросить, что он имел в виду, и половина приёмки происходила в коротком разговоре, а не в вычитке.
Сейчас же объём перестал быть ограниченным, а намерения за текстом часто нет — не потому, что автор его скрыл, а потому, что не формировал: артефакт произведён моделью по одноклеточному промпту, и человек, который его принёс, иногда сам не объяснит, почему там написано именно так.
Спросить стало не у кого.
Отсюда следствие, которое кажется мне важнее самого перепроизводства. За непроверяемыми сорока страницами чаще стоит отсутствие источника правды, чем избыток объёма. Прежний результат человеческой усидчивости был капиталом: писали десять страниц про то, что твёрдо знали. Модель пишет сорок и заполняет правдоподобным текстом те места, для которых у процесса нет доступного и авторитетного источника правды. Знание при этом в организации вполне может быть: у трёх разных людей по кусочку, в неформализованном виде, в соседнем подразделении, в самом изделии или в физическом процессе — но у модели к нему нет доступа, и нет никого, кто отвечает за то, что здесь считается верным ответом. Проверить написанное нельзя не потому, что долго, а потому, что не с чем сверять.
IT сектор заметил это позже других, но громче
Пока проверка масштабируется вместе с производством, перепроизводство приемлемо
Любопытно, что громче всего про перепроизводство говорят сейчас в разработке, хотя, по моим наблюдениям, проявилось оно там позже, чем в юридических, проектных и управленческих процессах. У юристов и проектировщиков вылезло почти сразу: ассистент собрал договор за пятнадцать минут, и договор встал ждать юриста; руководитель проекта выпустил сорок страниц руководства по эксплуатации, и они легли в очередь к единственному человеку, способному подтвердить, что написанное соответствует реальному изделию.
Разработка держалась дольше по понятной причине. Инженеры давно придумали тестирование — это та часть критерия приёмки, которую удалось выразить в машиноисполняемой форме. Отрасль привыкла, что доказательство пригодности лежит рядом с результатом отдельным артефактом и исполняется автоматически. Пока проверка масштабируется вместе с производством, перепроизводство приемлемо, и код спокойно принял кратный рост генерации.
Уперлось и здесь, но там, где проверка снова стала человеческой: в чтении чужих изменений, в оценке архитектурных решений, в вопросе «а то ли мы вообще делаем». То есть разработка идёт тем же путём, просто с форой в накопленную дисциплину.
Вывод получается такой: перепроизводство приемлемо там, где результат есть с чем сверить — с тестом, с расчётом, с замером, с фактом. И деструктивно там, где сверять приходится глазами с ничем.
Подписывали не глядя и раньше
Подписывали и раньше, но за каждой бумагой стоял автор, с которого можно спросить
Вы скажете: не выдумывай, толком никто ничего и раньше не читал. Регламенты подписывали не глядя, тома проектной документации листали по диагонали, договор проверяли по трём пунктам из сорока, а совет директоров получал материалы за сутки до заседания и открывал их в машине по дороге. Организации держались на доверии к людям, а не на чтении бумаг, и непрочитанная страница была фикцией задолго до языковых моделей.
Частично с возражением согласен, но предохранитель был, и это было не чтение, а автор.
За документом стоял человек, которому можно задать вопрос и с которого можно спросить потом. Он знал, что его будут спрашивать, и это знание работало сильнее любой вычитки: писать заведомую ерунду невыгодно, когда через месяц придётся объяснять её вслух на совещании. Настоящая проверка происходила не в момент подписи, а в голове автора заранее, а подпись принимающего была не столько актом контроля, сколько переносом репутационного риска на конкретную фамилию.
Сломалось именно это. Человек, который приносит сорок страниц от модели, не проверял их заранее в собственной голове — он их не писал. Спросить с него по-прежнему можно, но содержательно ответить он сможет разве что «так сгенерировалось».
Обычно спорят, что будет дальше: упрёмся в регламенты и затормозим или махнём рукой и потеряем качество. По мне, спор пустой — если ничего не менять, показатели останутся прекрасными, контроль на бумаге продолжит работать, а накопленный дефект вылезет весь разом и в самый неудобный момент. Виноватых при этом не найдётся: когда документ длиннее, чем человек способен прочитать, подпись превращается в галочку автоматически. И обратно оно само не переклеится — проверку придётся перестраивать, руками и намеренно.
За доказательство теперь надо платить отдельно
Стоимость проверки переехала из человеко-часов в вычисления, а вычисления можно докупить
Проверка чтением стоит ровно столько, сколько страниц: вдвое больше текста — вдвое больше человеко-часов. Думающие модели с длинной цепочкой рассуждений эту арифметику ломают. Там, где им дают исходник, стандарт, чек-лист, базу фактов или внешний инструмент, они забирают большую часть рутины: сверяют документ с источником, ловят внутренние противоречия, находят пропуски, проверяют соответствие форме.
Отсюда правило: на проверку разумно тратить больше, чем на производство. Сегодня обычно наоборот — один проход генерации и в лучшем случае одна вычитка. Сколько именно тратить, считается от риска: чем страшнее пропущенная ошибка и чем слабее доступные источники правды, тем больше проверки.
Выборочный контроль от этого не умирает, а переезжает уровнем выше. Когда каждый документ проходит сплошную автоматическую проверку, выборочно проверять надо уже не документы, а сам контур: что он систематически пропускает и не поплыл ли со временем. Ну и там, где испытание дорогое или разрушает изделие, выборка никуда не денется.
Условие у всей этой конструкции одно: ошибки проверяющих должны быть независимыми. Две модели одного семейства, проверяющие друг друга, — это два манометра с одного завода, у которых одинаково сбит ноль: показания совпадут даже там, где оба врут. Архитектура общая, способ обучения общий, источники пересекаются, постановка задачи одинаковая, тяга к правдоподобному одна на двоих — случайный шум такая пара ловит прекрасно, а систематическую ошибку не видит. Что именно было в данных обучения, снаружи никто не знает, но корреляция ошибок между моделями фиксируется устойчиво, и разные семейства её снижают, а не убирают.
Значит непохожесть придётся строить намеренно: разные семейства моделей и разные роли — одна сверяет с источником, вторая играет за оппонента и обязана найти дефект, третья идёт формально по стандарту. И важнее непохожесть доказательств, чем непохожесть моделей: модель плюс расчёт плюс выписка из реестра плюс замер на объекте сильнее, чем просто пять разных моделей.
Складно — ещё не правда
Внутри текста можно проверить всё, кроме одного: правда ли он
Соблазн после этого понятный: выстроить конвейер, где машина производит и проверяет, а человек появляется в конце и подписывает.
Так не выйдет, и дело даже не в качестве моделей. Модель проверит, что документ складный: не противоречит сам себе, исходным данным, стандарту и предыдущей версии. А что исходные данные неверны, цель поставлена не та и станок в цеху не тот, который указан в спецификации, — она не увидит: этого нет в тексте, это есть в реальности, а модель видит только чьё-то описание этой реальности.
И граница здесь проходит не между машиной и человеком. К реальности выводит не обязательно человек: датчик, испытательный стенд, лабораторный анализ, государственный реестр, банковская проводка, геодезическая съёмка — всё это источники правды, и каждый из них сильнее самого внимательного чтения. А человек, который читает тот же ошибочный документ, с реальностью может не соприкасаться вообще.
За человеком остаются две вещи. Сказать, что здесь считается хорошим — какой кусок реальности принимается за истину и с чем идёт сверка. И принять решение вместе с последствиями. Спорные случаи туда же: когда два источника говорят разное, когда дефект незнакомого типа, когда поменялась сама цель или когда надо разменивать безопасность на деньги и сроки — где критерия нет, решает человек. Всё остальное — работа с текстом при помощи текста — отдаётся машине.
При этом проверка, собранная вокруг неверного источника правды, опаснее, чем её отсутствие, потому что производит незаработанную уверенность. Кривой исходник раньше выявлялся при проверке первым же человеком, который читал и морщился. Теперь он проходит пять зелёных проверок и приезжает к подписанту с отчётом о полном соответствии.
Меняется и то, что ложится на подпись. Если промежуточных людей из цепочки убрать, весь объём доедет до последней подписи, и узким местом станет подписант. Значит класть ему на стол надо не сорок страниц, а выжимку: что проверено и чем, что не сошлось, что исправили и какие вопросы машина решить не смогла. Подписывает он при этом по-прежнему весь документ — выжимка сокращает чтение, а не ответственность. И сама подпись, строго говоря, не доказывает, что человек читал: право подписи делегируют, ответственность распределяют, подпись лишь фиксирует, с кого спрашивать. Тем важнее, чтобы вместе с ней был приложен пакет доказательств.
Каким становится регламент
Контур проверки — тоже изделие, и его самого надо испытывать
Старый регламент отвечает на один вопрос — кто кого проверяет: должности, подписи, сроки согласования. Новому придётся отвечать на другие вопросы: с чем сверяется каждый документ, насколько непохожи друг на друга те, кто его проверяет, на чём конвейер обязан остановиться и в какой момент к делу подключается человек.
Испытывать регламенты умели и раньше — внутренний аудит ровно этим и занимается: смотрит, ловит ли контроль то, ради чего его завели. Ново то, что модельный контур можно мерить в цифрах: регулярно прогонять через него документы с заранее заложенными дефектами и считать, сколько поймано.
Одной доли пойманного мало: важно, сколько ложных тревог, какие дефекты пропускаются чаще и не съезжает ли качество со временем. Иначе легко построить проверяющего, который находит дефект в каждом абзаце и на бумаге выглядит безупречно. Насколько я вижу, это и есть лекарство от галочки: доверие к проверке становится измеренным, а не объявленным.
Второе, что придётся достроить, — память. В согласовании документов замечание чаще всего остаётся в переписке или в голове эксперта и не превращается в правило, которое машина применит сама. Без этого перевода контур проверяет каждый документ с нуля, и эксперт делает одно и то же замечание в сотый раз, только теперь быстрее и в большем объёме. Замечание, не превратившееся в строчку эталона, — потраченное впустую время и внимание человека.
Чем будут различаться организации
Различать будет не умение генерировать, а умение выносить критерий наружу
Я предполагаю, что разрыв в умении генерировать схлопнется быстрее, чем успевают написать про него стратегию: модели общие, доступ примерно одинаковый, люди уже пользуются моделями даже там, где им запрещают.
Важно выработать навык вынимать вкус, опыт и чутьё человека из головы в форму, которую машина может применить сама. И умение удерживать связь результата с реальностью, а не с описанием реальности: возвращаться к станку, к объекту, к клиенту и сверять, что мир всё ещё такой, каким его однажды записали. Первое даёт скорость, второе не даёт этой скорости увезти не туда.
Ни то ни другое не покупается и не поручается подрядчику — нужно время человека, компетенции которого мы будем использовать в этой работе. И этого времени на старте потребуется много.
Очень много — это я из практики говорю: я начал строить такие HITL-системы (human-in-the-loop, человек в контуре) с себя, и сейчас разрыв между тем, что выдаёт такая связка, и тем, что выдают люди, наконец-то дорвавшиеся до LLM, сложно даже измерить.
Если статья оказалась полезной и хочется что-то обсудить — не стесняйтесь.
