Mercury 2.5: диффузионная модель от Inception Labs для мгновенной обработки данных
данным Testomat.io, Inception Labs выпустила Mercury 2.5 — диффузионную языковую модель (dLLM) с контекстным окном 260 000 токенов и заявленной скоростью генерации 1 107 токенов в секунду на стандартных GPU NVIDIA.

Архитектура параллельного декодирования нацелена на снижение задержек в RAG-пайплайнах, поисковых агентах и быстрой суммаризации объемных массивов источников. Для ниши информационных суммаризаторов и новостных дайджестов релиз интересен параметром задержки — это прямой бюджетный ограничитель для систем реального времени.
Заявленные характеристики
- Контекстное окно: 260 000 токенов
- Скорость генерации: 1 107 токенов в секунду
- Аппаратная база: стандартные GPU NVIDIA (модель в источнике не уточнена)
- Архитектура: параллельное декодирование, диффузионная модель
- Целевые сценарии по версии вендора: RAG, поисковые агенты, суммаризация
Что это меняет для ниши
Диффузионная архитектура генерирует токены параллельно, а не последовательно, как авторегрессионные LLM. Практические следствия для пайплайнов суммаризации:
- Обработка корпуса в 260K токенов укладывается в минуты, не часы
- Возможна суммаризация новостных потоков в реальном времени без буферизации выхода
- Потенциальное снижение TCO инференса при сохранении качества — требует проверки
Определение «крупнейшая» в исходном описании — маркетинговая характеристика без указания метрики. Позиционирование, не измеримый параметр.
Что проверить до интеграции
Источник публикует только параметры скорости. Бенчмарки качества отсутствуют. До перехода проверить:
- Режим доступа: API, open-source веса или enterprise-only — в анонсе не указано
- Воспроизводимость 1 107 токенов/с на конкретной модели GPU (A100, H100, L40S)
- Качество суммаризации на длинных контекстах (200K+ токенов): скорость не гарантирует сохранение точности
- Стоимость инференса в пересчете на 1K токенов vs. авторегрессионные аналоги
- Совместимость с текущими RAG-фреймворками и оркестраторами
Вердикт: Mercury 2.5 — заявка на смену архитектурного baseline для low-latency RAG и суммаризации. До публичных бенчмарков и независимых тестов воспринимать как сигнал о направлении, не как готовую замену текущим пайплайнам.