3,1 миллиарда токенов за первые сутки. Столько сожрал мой AI-оркестр, когда я только начинал настраивать Paperclip. Не миллионер, не корпорация — просто вовремя понял главное правило: разные модели для разных задач. Иначе подписка ложится за полтора часа, а проект остаётся недоделанным.

Ниже — рабочая трёхуровневая архитектура, которая помогла довести систему до конца и при этом не уйти в минус.

Откуда взялись 3 миллиарда токенов

Контекст: внедрял Paperclip как систему антикризисного управления в торговую компанию. 14 ролей — CEO, финансовый директор, маркетолог, разработчики, дизайнеры, cold-outreach менеджеры. У каждой роли свой промпт, свои инструменты, своя зона ответственности.

На старте была подписка ChatGPT за 200 долларов в неделю. Думал — безлимит, жги сколько хочешь. Через полтора часа подписка легла: rate limit, 100% использования, полная блокировка. Codex успел выполнить процентов 60 работы.

Что такое Paperclip

Paperclip — open-source операционка для AI-компаний. Не чат-бот, не ассистент, а control plane для оркестрации десятков агентов:

  • Каждый агент — сотрудник со своей ролью и инструкциями
  • Тикеты вместо чатов — структурированная работа
  • Бюджеты и governance — контроль расходов
  • BYO agents — любые модели и провайдеры

На старте Paperclip честно показывает чудовищные цифры использования. Когда система настроена и роли распределены, расход стабилизируется.

Первая ошибка — всё на одной модели

GPT-5.3-codex — мощная кодовая модель, солидные лимиты. Я решил: пусть он один и тащит всю систему. Codex умный, разберётся.

Реальность: панель Paperclip начала выдавать 20–40 уведомлений в секунду, 500 обращений в минуту. Через полтора часа — rate limit. Codex выполнил 60% работы и лёг. Оставшиеся 40% делать было нечем.

Пересборка: трёхуровневая архитектура

Схема, которая спасла проект:

Уровень 1 — Архитектор (тяжёлая модель)

  • Модель: GPT-5.3-codex или Claude Opus
  • Задачи: онбординг, сложные скрипты, проектирование архитектуры
  • Когда использовать: первые 1–2 часа настройки. Дальше — только для нетривиальных задач
  • Расход: 60% работы за час, дальше не пускать

Уровень 2 — Оркестратор (умный, но экономичный)

  • Модели: DeepSeek 4 Pro, DeepSeek 4 Flash, Qwen 3, Kimi 2.6
  • Источник: OpenCode.Go — подписка от $5 первый месяц, далее $10
  • Задачи: написание спеков, планов, инструкций, управление другими агентами
  • Расход: 4% пятичасового лимита на всю работу

Уровень 3 — Рабочая лошадка (дешёвая и неубиваемая)

  • Модель: MiniMax
  • Подписка: от $10/мес
  • Задачи: основная масса рутины, cold outreach, генерация контента
  • Фишка: её невозможно высадить. Работает в OpenCode, в агентских системах, в мультиагентных схемах, даже как чат-бот с клиентами

Результат пересборки

Оставшиеся 40% работы система доделала за 30 минут. Потратили 10% лимита MiniMax + 4% лимита DeepSeek. Общий счёт — те самые 3,1 миллиарда токенов и около 4 000 подписочных запусков. На стодолларовом ChatGPT этот же объём встанет в несколько подписок и неделю простоя на rate limit.

Где брать модели дёшево

OpenCode.Go — лучшая находка для AI-разработчика в 2026 году. Подписка от $5/мес даёт доступ к десяткам моделей: DeepSeek 4 Flash, DeepSeek 4 Pro, Qwen 3, Qwen 6, Kimi 2.5, Kimi 2.6, плюс MiniMax и бесплатные модели. Пятичасовые окна, суммарно около $12 в день — для активной разработки выгоднее любого pay-as-you-go.

По реферальной ссылке первый месяц $5, и ещё $5 бонуса сверху. Итого два месяца за $10 с жирными лимитами. DeepSeek 4 Flash на этой подписке невозможно положить — нужно реально пахать.

Личный опыт: OpenCode как замена Claude Code

Раньше я использовал OpenCode чисто утилитарно — дёргал через CLI, чтобы подписки в Hermes засунуть. Инструмент был неплохой, но быстро отваливался по мере роста кодовых баз.

Сейчас OpenCode — другой уровень. Поддерживает Claude-совместимые скилы, по сути это бюджетная замена Claude Code.

Реальность рынка: Anthropic зарезал лимиты. Стодолларовые подписки работают как двадцатидолларовые. Покупаешь подписку за $20 — два запроса в Claude Code, и всё.

OpenCode за $5 в месяц даёт нормальные лимиты на хороших моделях. Можно кодить на Qwen 3.6 Plus, DeepSeek Pro. Поддерживаются Workflows (аналог Anthropic), субагенты, SuperPower. Нативные приложения под Mac и Windows, работа в терминале и в IDE.

Сравнение в цифрах. Интернет-магазин на Claude Code: подписка $100, неделя работы с постоянными упорами в лимиты. На OpenCode.Go: тот же магазин, и подписки хватит на десятки таких проектов. Нужен огромный магазин с тысячами SKU — добавляете ещё одну Go-подписку и получаете неубиваемый движок для разработки.

MiniMax: рабочая лошадка

4,3 миллиарда токенов, 52 дня стрика, топ 1.9% пользователей, самый жирный день — 417 миллионов токенов за сутки. И подписка даже не чихнула.

Стартовал с Max High Speed — его вообще нереально выжать, модели мгновенные. Потом перешёл на обычный Max, держит всё.

Что даёт MiniMax:

  • Кодинг. Обновился и стал хорошо понимать русский. Для большого кода и сложных длительных задач — идеальная модель
  • Чат-боты. Для простых ботов и общения с клиентами — дёшево, не положить
  • Генерация изображений. Отлично делает фото, использую везде в контенте
  • Видео: 2 на одной модели + 2 на другой = 4 ролика за окно
  • Музыка и тексты песен: до 100 песен за 5 часов
  • Веб-поиск и Vision: настроены на MiniMax, тоже невозможно высадить

Тарифы:

  • Starter ($10/мес): 1500 запросов за 5 часов. Для лёгких задач и тестирования
  • Plus ($80/мес): 4500 запросов за 5 часов. M2-highspeed, до 3× быстрее конкурентов
  • Max ($150/мес): 30 000 запросов за 5 часов. Под 4–5 агентов одновременно

Недельный лимит — 10× пятичасовой квоты. На Max это 300 000 запросов в неделю. Все тарифы включают генерацию текста, изображений, речи, музыки, видео, NLP-анализ картинок и MCP Web Search.

Мой Max тариф официально поддерживает 2–3 агента. По факту у меня их десяток, иногда два — ничего не ложится.

Связка-убийца

OpenCode.Go за $5–10 + MiniMax за $10 = дёшево, стабильно, без потолка. Человек за неделю собирает интернет-магазин с диким количеством SKU. Карточки товаров генерирует MiniMax. А на тарифе $50 (120 фото в день) — два шикарно наполненных магазина.

Это не баловство. Это рабочий дешёвый стек для продакшена.

Правила выживания

  1. Никогда не запускайте Codex или Opus на рутине. Они сожрут подписку быстрее, чем вы скажете «rate limit»
  2. Разделяйте роли: архитектор → оркестратор → рабочие лошадки. Это не экономия, а архитектурное требование
  3. OpenCode.Go + MiniMax + одна тяжёлая модель = железобетонный стек. Проверено на 3,1 млрд токенов
  4. Лимиты Paperclip пугают только на старте. Когда роли распределены, расход стабилизируется

Итог

3,1 миллиарда токенов за сутки — звучит страшно. Но при правильном стеке моделей это не $200 в час, а $10–15 за весь проект.

Главный урок: не воюйте одной моделью против всех задач. AI-оркестр — это оркестр. Скрипка не играет партию ударных, дирижёр не играет на скрипке. Стройте умные системы, а не дорогие.