Архитектура SKILL.state: как сократить расход токенов ИИ-агентов в 50 раз
Google и Университет Пердью представили SKILL.state — архитектуру для ИИ-агентов, сокращающую расход токенов на длинных последовательностях действий.

По данным Dev.by, вместо полной истории работы система сохраняет три ключевых элемента: постоянную инструкцию, структурированное состояние задачи и последнее наблюдение. Промежуточные рассуждения модели удаляются после каждого шага — в памяти остаются только обновления, необходимые для следующей итерации. Для операторов агентных пайплайнов и сервисов автоматической суммаризации новостей это прямой аргумент к пересчёту стоимости инференса.
Цифры по расходу токенов
- Gemini-3-Flash, 200 последовательных шагов, сравнение со стандартной периодической суммаризацией: ~6,18 млн токенов против ~122 тыс. Экономия ~50 раз. Точность — с 84% до 94%.
- Те же 200 шагов, сравнение с обычным ReAct: ~2,61 млн токенов против ~122 тыс. Экономия ~21 раз.
- Симуляция работы с программным репозиторием, 100 шагов: ~1,85 млн токенов против ~90 тыс. Экономия ~20 раз. Точность — с 53% до 78%.
Что не подтверждено
Архитектура протестирована на открытых моделях Gemma и Qwen и на публичных задачах: Linux-терминал, клиентское обслуживание. Claude Code и Codex в исследовании не участвовали — сравнений с коммерческими агентными продуктами в работе нет. Авторы позиционируют подход как модель-независимый, однако воспроизведение требует самостоятельной сборки. Код не опубликован; в статье приведены описание runtime и шаблоны промптов.
Что отслеживать на практике
- Публикация рабочей реализации SKILL.state и репозитория с примерами.
- Адаптация подхода сторонними агентными фреймворками.
- Замеры стоимости шага в продакшене при дальнейшем росте длины цепочки.
- Сравнительные тесты на Claude Code, Codex и закрытых моделях — их в исследовании нет.
Эффект масштабируется с длиной последовательности. На коротких задачах выигрыш скромнее, на сотнях шагов — кратный. Для оператора, ведущего многочасовую сессию с агентом, критична не только экономия токенов, но и собственная работоспособность: вопросы устойчивой концентрации при длительной нагрузке, включая альтернативы кофе и чаю для поддержки нервной системы, остаются за пределами архитектуры, но напрямую влияют на итог.
Вердикт: 50-кратная экономия получена в сравнении с архитектурой периодической суммаризации истории, не с «чистым» ReAct. На реальных сценариях выигрыш ближе к 20 раз. Промышленная готовность не подтверждена, воспроизведение требует самостоятельной сборки runtime.