3,1 миллиарда токенов за первые сутки. Столько сожрал мой AI-оркестр, когда я только начинал настраивать Paperclip. Не миллионер, не корпорация — просто вовремя понял главное правило: разные модели для разных задач. Иначе подписка ложится за полтора часа, а проект остаётся недоделанным.
Ниже — рабочая трёхуровневая архитектура, которая помогла довести систему до конца и при этом не уйти в минус.
Откуда взялись 3 миллиарда токенов
Контекст: внедрял Paperclip как систему антикризисного управления в торговую компанию. 14 ролей — CEO, финансовый директор, маркетолог, разработчики, дизайнеры, cold-outreach менеджеры. У каждой роли свой промпт, свои инструменты, своя зона ответственности.
На старте была подписка ChatGPT за 200 долларов в неделю. Думал — безлимит, жги сколько хочешь. Через полтора часа подписка легла: rate limit, 100% использования, полная блокировка. Codex успел выполнить процентов 60 работы.
Что такое Paperclip
Paperclip — open-source операционка для AI-компаний. Не чат-бот, не ассистент, а control plane для оркестрации десятков агентов:
- Каждый агент — сотрудник со своей ролью и инструкциями
- Тикеты вместо чатов — структурированная работа
- Бюджеты и governance — контроль расходов
- BYO agents — любые модели и провайдеры
На старте Paperclip честно показывает чудовищные цифры использования. Когда система настроена и роли распределены, расход стабилизируется.
Первая ошибка — всё на одной модели
GPT-5.3-codex — мощная кодовая модель, солидные лимиты. Я решил: пусть он один и тащит всю систему. Codex умный, разберётся.
Реальность: панель Paperclip начала выдавать 20–40 уведомлений в секунду, 500 обращений в минуту. Через полтора часа — rate limit. Codex выполнил 60% работы и лёг. Оставшиеся 40% делать было нечем.
Пересборка: трёхуровневая архитектура
Схема, которая спасла проект:
Уровень 1 — Архитектор (тяжёлая модель)
- Модель: GPT-5.3-codex или Claude Opus
- Задачи: онбординг, сложные скрипты, проектирование архитектуры
- Когда использовать: первые 1–2 часа настройки. Дальше — только для нетривиальных задач
- Расход: 60% работы за час, дальше не пускать
Уровень 2 — Оркестратор (умный, но экономичный)
- Модели: DeepSeek 4 Pro, DeepSeek 4 Flash, Qwen 3, Kimi 2.6
- Источник: OpenCode.Go — подписка от $5 первый месяц, далее $10
- Задачи: написание спеков, планов, инструкций, управление другими агентами
- Расход: 4% пятичасового лимита на всю работу
Уровень 3 — Рабочая лошадка (дешёвая и неубиваемая)
- Модель: MiniMax
- Подписка: от $10/мес
- Задачи: основная масса рутины, cold outreach, генерация контента
- Фишка: её невозможно высадить. Работает в OpenCode, в агентских системах, в мультиагентных схемах, даже как чат-бот с клиентами
Результат пересборки
Оставшиеся 40% работы система доделала за 30 минут. Потратили 10% лимита MiniMax + 4% лимита DeepSeek. Общий счёт — те самые 3,1 миллиарда токенов и около 4 000 подписочных запусков. На стодолларовом ChatGPT этот же объём встанет в несколько подписок и неделю простоя на rate limit.
Где брать модели дёшево
OpenCode.Go — лучшая находка для AI-разработчика в 2026 году. Подписка от $5/мес даёт доступ к десяткам моделей: DeepSeek 4 Flash, DeepSeek 4 Pro, Qwen 3, Qwen 6, Kimi 2.5, Kimi 2.6, плюс MiniMax и бесплатные модели. Пятичасовые окна, суммарно около $12 в день — для активной разработки выгоднее любого pay-as-you-go.
По реферальной ссылке первый месяц $5, и ещё $5 бонуса сверху. Итого два месяца за $10 с жирными лимитами. DeepSeek 4 Flash на этой подписке невозможно положить — нужно реально пахать.
Личный опыт: OpenCode как замена Claude Code
Раньше я использовал OpenCode чисто утилитарно — дёргал через CLI, чтобы подписки в Hermes засунуть. Инструмент был неплохой, но быстро отваливался по мере роста кодовых баз.
Сейчас OpenCode — другой уровень. Поддерживает Claude-совместимые скилы, по сути это бюджетная замена Claude Code.
Реальность рынка: Anthropic зарезал лимиты. Стодолларовые подписки работают как двадцатидолларовые. Покупаешь подписку за $20 — два запроса в Claude Code, и всё.
OpenCode за $5 в месяц даёт нормальные лимиты на хороших моделях. Можно кодить на Qwen 3.6 Plus, DeepSeek Pro. Поддерживаются Workflows (аналог Anthropic), субагенты, SuperPower. Нативные приложения под Mac и Windows, работа в терминале и в IDE.
Сравнение в цифрах. Интернет-магазин на Claude Code: подписка $100, неделя работы с постоянными упорами в лимиты. На OpenCode.Go: тот же магазин, и подписки хватит на десятки таких проектов. Нужен огромный магазин с тысячами SKU — добавляете ещё одну Go-подписку и получаете неубиваемый движок для разработки.
MiniMax: рабочая лошадка
4,3 миллиарда токенов, 52 дня стрика, топ 1.9% пользователей, самый жирный день — 417 миллионов токенов за сутки. И подписка даже не чихнула.
Стартовал с Max High Speed — его вообще нереально выжать, модели мгновенные. Потом перешёл на обычный Max, держит всё.
Что даёт MiniMax:
- Кодинг. Обновился и стал хорошо понимать русский. Для большого кода и сложных длительных задач — идеальная модель
- Чат-боты. Для простых ботов и общения с клиентами — дёшево, не положить
- Генерация изображений. Отлично делает фото, использую везде в контенте
- Видео: 2 на одной модели + 2 на другой = 4 ролика за окно
- Музыка и тексты песен: до 100 песен за 5 часов
- Веб-поиск и Vision: настроены на MiniMax, тоже невозможно высадить
Тарифы:
- Starter ($10/мес): 1500 запросов за 5 часов. Для лёгких задач и тестирования
- Plus ($80/мес): 4500 запросов за 5 часов. M2-highspeed, до 3× быстрее конкурентов
- Max ($150/мес): 30 000 запросов за 5 часов. Под 4–5 агентов одновременно
Недельный лимит — 10× пятичасовой квоты. На Max это 300 000 запросов в неделю. Все тарифы включают генерацию текста, изображений, речи, музыки, видео, NLP-анализ картинок и MCP Web Search.
Мой Max тариф официально поддерживает 2–3 агента. По факту у меня их десяток, иногда два — ничего не ложится.
Связка-убийца
OpenCode.Go за $5–10 + MiniMax за $10 = дёшево, стабильно, без потолка. Человек за неделю собирает интернет-магазин с диким количеством SKU. Карточки товаров генерирует MiniMax. А на тарифе $50 (120 фото в день) — два шикарно наполненных магазина.
Это не баловство. Это рабочий дешёвый стек для продакшена.
Правила выживания
- Никогда не запускайте Codex или Opus на рутине. Они сожрут подписку быстрее, чем вы скажете «rate limit»
- Разделяйте роли: архитектор → оркестратор → рабочие лошадки. Это не экономия, а архитектурное требование
- OpenCode.Go + MiniMax + одна тяжёлая модель = железобетонный стек. Проверено на 3,1 млрд токенов
- Лимиты Paperclip пугают только на старте. Когда роли распределены, расход стабилизируется
Итог
3,1 миллиарда токенов за сутки — звучит страшно. Но при правильном стеке моделей это не $200 в час, а $10–15 за весь проект.
Главный урок: не воюйте одной моделью против всех задач. AI-оркестр — это оркестр. Скрипка не играет партию ударных, дирижёр не играет на скрипке. Стройте умные системы, а не дорогие.