Мы решили автоматизировать самую скучную часть найма — первичный отбор кандидатов. План был простой: агент заходит в HeadHunter, видит отклик, анализирует резюме и сам отправляет приглашение на собеседование. Казалось бы, задача для любого современного ИИ.

Ловушка за 100 долларов: почему GPT-5.6 Sol не заработала

Для этого проекта мы выбрали одну из самых дорогих моделей — GPT-5.6 Sol. Подписка стоит 100 долларов в месяц. В рекламе обещали невероятный интеллект и огромный объем памяти, в который влезает целая библиотека книг.

На деле мы получили «архитектуру-петлю». Модель писала очень вежливо и умными словами, но полностью игнорировала конечную цель. Чтобы агент просто прочитал сообщение от кандидата, нам приходилось дважды нажимать кнопки в панели управления. Он зацикливался на собственных рассуждениях и забывал, что должен отправить приглашение.

Самое неприятное обнаружилось при замере памяти. Заявлено было 272 тысячи токенов. Но в реальности около 100 тысяч съедались системой сразу при запуске. Агент начинал работу фактически «вслепую», теряя часть важных инструкций уже на старте. В итоге за 100 долларов мы купили очень дорогую игрушку, которая умеет красиво говорить, но не умеет работать.

Сюрприз за 10 долларов: DeepSeek 4 Flash

Чтобы не бросать задачу, мы попробовали DeepSeek 4 Flash. Эта модель стоит всего 10 долларов в месяц. Мы подключили её к нашей системе управления агентами Hermes.

Результат нас удивил. DeepSeek не пытался казаться умнее всех. Он просто делал то, что просили: видел отклик, проверял опыт и отправлял письмо. Никаких петель, никаких лишних нажатий кнопок. Всё работало четко и предсказуемо.

Оказалось, что для агентной работы важна точность следования инструкции. Это когда ИИ должен совершать действия в реальных программах. В этом плане точность важнее, чем «глубина размышлений». DeepSeek в этом плане оказался на голову выше своего дорогого конкурента.

Честное ограничение: риски китайских вендоров

Конечно, решение с DeepSeek не идеально. Это китайский вендор. В отличие от американских компаний, здесь нет официальной поддержки на русском или английском языке в привычном виде.

Нет никаких гарантий доступности сервиса. Завтра доступ к API могут ограничить или изменить условия использования. Для нас это приемлемый риск, потому что экономия в 10 раз перевешивает возможные неудобства. Но если ваш бизнес зависит от стопроцентной стабильности системы, полагаться только на одного китайского поставщика опасно.

Как проверить модель и не сжечь бюджет

Эта история научила нас главному: никогда не верьте таблицам лидеров и рекламным цифрам. В них модели решают математические задачи или пишут код, который потом проверяет другой робот. В жизни всё иначе.

Вот как мы теперь проверяем любую модель перед внедрением:

1. Берем реальный файл с данными (например, выгрузку из 1С или прайс). 2. Ставим конкретную задачу с измеримым результатом: «Разложи эти 100 позиций по трем папкам». 3. Проверяем, сколько раз нам пришлось «подталкивать» модель, чтобы она закончила дело. 4. Замеряем реальный объем памяти: отправляем длинный текст и просим вспомнить деталь из самого начала.

Только так можно понять, подходит ли модель для вашего бизнеса. Рекламные цифры созданы для того, чтобы вы купили подписку. Реальные тесты созданы для того, чтобы ваш бизнес работал. Проверяйте всё на своих файлах.