Perplexity представила открытый бенчмарк Q2D-Web для оценки качества RAG-систем
Perplexity опубликовала Q2D-Web — открытый бенчмарк для оценки поиска в RAG-суммаризаторах…

По данным Perplexity Blog, компания опубликовала бенчмарк Q2D-Web с открытым лидербордом. Назначение инструмента — объективная оценка эмбеддингов и моделей первого этапа поиска, на основе которых формируются контекстные выборки для суммаризации. Для рынка информационных суммаризаторов это переход от внутренних метрик вендора к воспроизводимой публичной оценке.
Состав и параметры
- Объём корпуса: 190 млн веб-документов.
- Запросная база: около 70 тыс. агентных поисковых сценариев.
- Языковое покрытие: 10 языков.
- Формат: открытый датасет и публичный лидерборд.
Масштаб корпуса задаёт репрезентативную выборку: 190 млн документов покрывают значительный массив открытого веба, 70 тыс. запросов дают статистически значимый объём для оценки моделей. Многоязычность (10 языков) снимает ограничение англоязычных eval-сетов, ранее доминировавших в отрасли.
Методология и значение для ниши
Q2D-Web оценивает два слоя конвейера суммаризации:
- Эмбеддинги. Качество представления документов и запросов в векторном пространстве определяет полноту и точность отбора. Ошибка на этом слое не компенсируется последующей генерацией.
- Модели первого этапа поиска. Эффективность retrieval-компонента задаёт верхнюю границу качества контекста, поступающего на вход суммаризатору. Эти компоненты формируют контекстные выборки для суммаризации.
Логика бенчмарка — измерить входной слой, на котором строится итоговый ответ. Если retrieval ошибается, суммаризатор воспроизводит чужую ошибку; корректная генерация поверх неверного контекста методически невозможна. Q2D-Web фиксирует узел, где ошибка возникает первой, и задаёт нижнюю границу качества всей системы.
Для пользователя и интегратора это переход от качественных демонстраций к количественному сравнению. Позиция модели в открытом лидерборде становится аргументом при выборе инструмента. Принцип сопоставим с открытыми критериями оценки в других потребительских категориях — например, при оценке результатов имплантации зубов по фото работ и заранее заданным критериям клиники также ранжируются по объективным показателям, а не по рекламным обещаниям.
Что отслеживать
- Появление независимых воспроизведений результатов Q2D-Web сторонними лабораториями.
- Позиции открытых моделей (open weights) в лидерборде.
- Расширение датасета по языкам и тематическим доменам.
- Включение Q2D-Web в пайплайн оценки коммерческих суммаризаторов.
Итог: Q2D-Web — количественная база для сравнения retrieval-слоя суммаризаторов. Это не финальная метрика качества ответа, но первый публичный фильтр, отсекающий компоненты поиска с высоким уровнем ошибки. Для аудитории ниши релиз смещает выбор инструментария из области деклараций в область воспроизводимых измерений.