digestors.

Понятно, практично, по делу

Perplexity представила открытый бенчмарк Q2D-Web для оценки качества RAG-систем

Perplexity опубликовала Q2D-Web — открытый бенчмарк для оценки поиска в RAG-суммаризаторах…

Perplexity представила открытый бенчмарк Q2D-Web для оценки качества RAG-систем

По данным Perplexity Blog, компания опубликовала бенчмарк Q2D-Web с открытым лидербордом. Назначение инструмента — объективная оценка эмбеддингов и моделей первого этапа поиска, на основе которых формируются контекстные выборки для суммаризации. Для рынка информационных суммаризаторов это переход от внутренних метрик вендора к воспроизводимой публичной оценке.

Состав и параметры

  • Объём корпуса: 190 млн веб-документов.
  • Запросная база: около 70 тыс. агентных поисковых сценариев.
  • Языковое покрытие: 10 языков.
  • Формат: открытый датасет и публичный лидерборд.

Масштаб корпуса задаёт репрезентативную выборку: 190 млн документов покрывают значительный массив открытого веба, 70 тыс. запросов дают статистически значимый объём для оценки моделей. Многоязычность (10 языков) снимает ограничение англоязычных eval-сетов, ранее доминировавших в отрасли.

Методология и значение для ниши

Q2D-Web оценивает два слоя конвейера суммаризации:

  • Эмбеддинги. Качество представления документов и запросов в векторном пространстве определяет полноту и точность отбора. Ошибка на этом слое не компенсируется последующей генерацией.
  • Модели первого этапа поиска. Эффективность retrieval-компонента задаёт верхнюю границу качества контекста, поступающего на вход суммаризатору. Эти компоненты формируют контекстные выборки для суммаризации.

Логика бенчмарка — измерить входной слой, на котором строится итоговый ответ. Если retrieval ошибается, суммаризатор воспроизводит чужую ошибку; корректная генерация поверх неверного контекста методически невозможна. Q2D-Web фиксирует узел, где ошибка возникает первой, и задаёт нижнюю границу качества всей системы.

Для пользователя и интегратора это переход от качественных демонстраций к количественному сравнению. Позиция модели в открытом лидерборде становится аргументом при выборе инструмента. Принцип сопоставим с открытыми критериями оценки в других потребительских категориях — например, при оценке результатов имплантации зубов по фото работ и заранее заданным критериям клиники также ранжируются по объективным показателям, а не по рекламным обещаниям.

Что отслеживать

  • Появление независимых воспроизведений результатов Q2D-Web сторонними лабораториями.
  • Позиции открытых моделей (open weights) в лидерборде.
  • Расширение датасета по языкам и тематическим доменам.
  • Включение Q2D-Web в пайплайн оценки коммерческих суммаризаторов.

Итог: Q2D-Web — количественная база для сравнения retrieval-слоя суммаризаторов. Это не финальная метрика качества ответа, но первый публичный фильтр, отсекающий компоненты поиска с высоким уровнем ошибки. Для аудитории ниши релиз смещает выбор инструментария из области деклараций в область воспроизводимых измерений.