qwane

разбор без магии

Как создать ИИ-агента и когда этого делать не надо

Собрать агента, который работает на демонстрации, — вечер. Собрать агента, которому можно дать доступ к рабочей системе, — совсем другая задача.

Разберу по частям, потому что вокруг слова «агент» скопилось много тумана. Агент — это модель, которой дали набор инструментов и разрешили самой решать, какой вызвать и в каком порядке, пока задача не будет выполнена. Всё. Не уровень интеллекта, не размер модели, не модный фреймворк — только наличие рук и права ими пользоваться.

Отсюда следует главное: сложность живёт не в промпте. Промпт — самая дешёвая и самая переписываемая часть. Дорого стоит всё вокруг: описания инструментов, которые невозможно понять превратно; права, не превышающие права позвавшего человека; поведение при обрыве на третьем шаге из пяти; потолок числа шагов, чтобы исполнитель не крутился в цикле за ваш счёт; лог, по которому потом восстанавливают, что именно произошло.

Практический критерий, по которому я решаю, нужен ли агент вообще, простой. Если задача — ответить на вопрос, агент не нужен: хватит поиска по вашим документам с генерацией ответа. Он оправдан там, где надо совершить несколько действий, каждое по отдельности простое, а ошибка обратима. Там, где действие необратимо — деньги, удаление, отправка наружу, — исполнитель готовит, а нажимает человек.

Отдельно про проверку, потому что её почти всегда откладывают. Обычный тест здесь не работает: один и тот же запрос дважды даёт разные формулировки, и сравнение строк ничего не показывает. Проверяется другое — какие инструменты были вызваны, с какими аргументами и в каком порядке. Это уже детерминированно, это можно зафиксировать набором сценариев и прогонять при каждом изменении промпта. Без такого набора любая правка формулировки становится ставкой: что-то улучшилось, что-то сломалось, и узнаете вы об этом от пользователей.

В партнёрской платформе копайлот работает ровно по этой схеме: собирает оффер и промо-материалы через инструменты платформы, в границах прав вызвавшего пользователя, с предпросмотром перед созданием. Ниже — что именно пришлось спроектировать, чтобы это можно было включить не только на демонстрации.

Что здесь идёт не так

От промпта до нескольких агентов: что добавляется на каждом уровне

УровеньЧто добавляетсяЧто становится дорого
ПромптОдин запрос — один ответНичего; и проверить ответ по источнику нельзя
Ответ по своим даннымПоиск фрагментов в ваших документах перед ответомПодготовка и регулярное обновление индекса
АссистентКонтекст пользователя и права на чтениеИнтеграции с системами и разграничение доступа
Агент с инструментамиПраво действовать и самому выбирать порядок шаговОткаты, подтверждения, лимиты шагов, полный лог
Несколько агентовРазделение ролей и передача задач между нимиОтладка: ошибка размазывается по цепочке исполнителей

Что входит

Для кого

техническим руководителям и владельцам продуктов, которые прикидывают, строить ли такую штуку и во что она выльется в эксплуатации.

Частые вопросы

Можно собрать это на готовом конструкторе?
Прототип — да, и это разумный способ проверить идею за вечер. Проблемы начинаются на второй неделе эксплуатации: права, откаты, лимиты расхода и лог. Конструкторы закрывают самую лёгкую часть задачи, а счёт приходит за самую тяжёлую.
Какая модель нужна?
Разные на разных шагах. Дешёвая справляется с классификацией и извлечением полей, сильная нужна там, где надо рассуждать и выбирать инструмент. Держать всё на одной сильной модели — простой способ получить неприятный счёт, а привязка к одному провайдеру означает переписывание продукта при его смене.
Сколько шагов допустимо?
Столько, сколько вы готовы оплатить и разобрать при сбое. Практический потолок ставится явно — и на число вызовов, и на стоимость одной задачи. Без потолка это однажды уйдёт в цикл, и узнаете вы об этом из счёта, а не из мониторинга.
Что будет при ошибке посреди цепочки?
То, что вы заранее спроектировали: откат, компенсирующее действие или остановка с передачей человеку и сохранением контекста. Если не спроектировано ничего, будет третий вариант — состояние, которого не ждал никто, и ручной разбор по логам.
Это заменит сотрудника?
Заменяется часть работы: рутинная, повторяемая, с дешёвой проверкой. Всё, где нужна ответственность за оценочное решение, остаётся человеку — не из этических соображений, а потому что отвечать за скидку клиенту перед вашим руководством будет человек.
Сколько времени занимает сборка?
Прототип на одном сценарии — дни. Версия, которую не страшно подключить к боевой системе, — от 2 недели, и разница между ними почти целиком в перечисленном выше: права, откаты, лимиты, лог и набор проверочных сценариев. Именно поэтому оценка «да там на выходных сделать» и реальный срок расходятся в разы, причём обе стороны при этом честны — они просто говорят о разных вещах.

Есть процесс, который просится под агента?

Опишите его — скажу, где агент окупится, где хватит обычной автоматизации, а где модель только добавит риск.

Обсудить проект

Смежное по ИИ-агентам

Все страницы про ИИ-агентов

Разбор по теме

Все разборы