digestors.

Понятно, практично, по делу

Новая модель Palmyra X6 от Writer: как сократить расходы на ИИ-агентов вдвое

По данным VentureBeat, связка даёт среднее снижение расходов на токены на 52%, ускорение многошаговых задач на 48% и прирост качества на 10%.

Новая модель Palmyra X6 от Writer: как сократить расходы на ИИ-агентов вдвое

Writer снижает счёт за агентов: что показывает Palmyra X6

Writer выпустила флагманскую модель Palmyra X6 и обновлённый оркестратор для ИИ-агентов. По данным VentureBeat, связка даёт среднее снижение расходов на токены на 52%, ускорение многошаговых задач на 48% и прирост качества на 10%. Среди клиентов Writer — Accenture, Uber, Vanguard.

Суть релиза и происхождение модели

Palmyra X6 не обучена с нуля. Это пост-тренинг открытой модели GLM-5.2 от пекинской Z.ai (бывшая Zhipu AI), что прямо указано в техническом отчёте Writer. Директор по продукту Matan-Paul Shetrit заявил VentureBeat, что модель полностью изолирована от исходных разработчиков и работает на инфраструктуре компании в США. Руководитель исследований Dan Bikel описал подход как взятие весов за отправную точку с последующим дообучением. Использование открытой китайской основы выводит Writer в центр дискуссии о допустимости американских enterprise-стеков на китайском фундаменте.

Экономика агентов и парадокс инференса

Goldman Sachs прогнозирует 24-кратный рост потребления токенов к 2030 году — до 120 квадриллионов в месяц, не за счёт большего числа запросов, а за счёт always-on агентов. Падение удельной цены не даёт падения счёта: если агентная задача потребляет в 20 раз больше токенов при снижении цены за токен на 75%, итоговые расходы растут пятикратно. CTO Writer Waseem AlShikh обозначил разрыв: рост потребления означает внедрение, но заказчику нужна плоская кривая затрат. По оценке Shetrit, главный барьер enterprise-внедрения — стоимость, а не возможности модели; альтернатива ИИ в большинстве кейсов — ручной труд. Shetrit также отверг тезис о каннибализации выручки: снижение стоимости расширяет TAM внутри организации за счёт задач, которые иначе не автоматизируются. Gartner описывает ту же динамику как «парадокс инференса»: расходы на работу агентов вырастут более чем в пять раз из-за усложнения многошаговых цепочек.

Что отслеживать и что меняется на рынке

  • Считать стоимость за задачу, не за токен. Агент превращает один запрос в циклы планирования, вызова инструментов, валидации и ретраев; счёт отражает весь цикл, а не ответ пользователю.
  • Фиксировать медианное и хвостовое потребление токенов на задачу до и после смены модели или оркестратора.
  • Запрашивать у поставщика происхождение весов и локацию инфраструктуры инференса — особенно при open-source китайских моделях в стеке.

Параллельно DeepSeek выпустила под лицензией MIT открытую среду для сборки ИИ-агентов вместе с обновлением модели V4-Pro. Порог входа в собственные стеки снижается, ценовое давление на коммерческих поставщиков усиливается.

Логика оркестрации — компактность, баланс, цена каждого лишнего шага — выходит за рамки ИИ; аналогичные задачи возникают, например, в тактической расстановке 4-4-1-1.