Оценка качества суммаризации: 5 ключевых метрик для проверки ИИ
Оценка качества суммаризации текста метриками не сводится к одному числу. ROUGE фиксирует пересечение слов и последовательностей, BLEU — точность совпадения n-грамм, BERTScore — семантическую…

Оценка качества суммаризации текста метриками не сводится к одному числу. ROUGE фиксирует пересечение слов и последовательностей, BLEU — точность совпадения n-грамм, BERTScore — семантическую близость, METEOR — более гибкое совпадение с учетом словоформ и синонимов, G-Eval — оценку по заданным критериям с помощью LLM-судьи.
Ниже — рабочая схема, а не рейтинг метрик. У каждой собственная зона применимости. Высокий ROUGE не доказывает отсутствие фактических ошибок. Хороший BERTScore не гарантирует сохранение чисел и отрицаний. Высокий балл G-Eval зависит от формулировки задания и поведения модели-судьи.
| Метрика | Что сравнивает | Основная польза | Ключевое ограничение |
|---|---|---|---|
| BLEU | Совпадение n-грамм и точность генерации | Проверка лексической близости и краткости | Создавалась для машинного перевода, плохо описывает смысл |
| ROUGE | Полноту совпадения с эталонным резюме | Контроль покрытия содержания | Не распознает фактическую ошибку при совпадении слов |
| BERTScore | Семантическую близость токенов в контексте | Учет синонимов и перефразирования | Смысловая близость не равна фактической корректности |
| METEOR | Совпадения с учетом словоформ, синонимов и порядка | Более гибкое сравнение с эталоном | Зависит от языковых ресурсов и правил сопоставления |
| G-Eval | Качество по критериям через LLM-судью | Проверку связности, полноты и релевантности | Оценка зависит от промпта, модели и нестабильности судьи |
Для новостных дайджестов одной автоматической метрики недостаточно. Минимальная схема включает лексическую метрику, семантическую метрику и отдельную проверку фактов. Иначе система будет оптимизироваться под совпадение формулировок, а не под точную передачу новости.
BLEU: точность совпадений, а не качество пересказа
BLEU появилась в 2002 году в работах исследователей IBM. Изначальная задача — оценка машинного перевода. Метрика сопоставляет машинный текст с эталонным и анализирует совпадение n-грамм: отдельных слов, пар слов, троек и более длинных последовательностей.
В расчет включается precision. Метрика смотрит, какая доля n-грамм в сгенерированном тексте встречается в эталоне. Дополнительно применяется штраф за краткость, или brevity penalty. Слишком короткий текст не должен получать высокий результат только потому, что в нем случайно совпали несколько ключевых слов.
Для суммаризации BLEU может быть полезна в узкой задаче: когда требуется проверить, насколько генерация близка к одному эталонному варианту по формулировкам. Это применимо к шаблонным уведомлениям, кратким карточкам и текстам с фиксированной терминологией.
Но новостная выжимка редко имеет единственную правильную формулировку. Одну и ту же информацию можно передать разными словами без потери смысла. BLEU будет снижать оценку за допустимый перефразированный вариант. И наоборот, механическое совпадение слов не означает, что модель правильно передала причинно-следственную связь.
Пример типовой ошибки:
- исходный текст сообщает, что регулятор предложил изменить правило;
- саммари пишет, что регулятор изменил правило;
- ключевые слова почти те же;
- BLEU может не отразить разницу между предложением и принятым решением.
Для оценки ИИ-выжимок это принципиально. В новостном дайджесте модальность, статус решения, дата и субъект действия часто важнее общего лексического сходства.
BLEU также чувствительна к длине. Слишком короткий пересказ получает штраф. Слишком длинный может накапливать лишние совпадения. Поэтому показатель нельзя интерпретировать отдельно от длины саммари и структуры исходного материала.
Практический вывод по BLEU:
- использовать как дополнительный лексический индикатор;
- не считать его метрикой фактической точности;
- не сравнивать без оговорок тексты разной длины;
- не делать вывод о качестве при наличии только одного эталонного резюме.
BLEU может показать, насколько генерация напоминает референс. Он не показывает, насколько саммари безопасно публиковать.
ROUGE: полнота передачи содержания
ROUGE разработал Чин-Ю Лин в 2004 году для оценки автоматического реферирования. В отличие от BLEU, метрика ориентирована на recall — полноту. Она проверяет, какая доля элементов эталонного резюме попала в машинную генерацию.
На практике чаще всего применяются три варианта:
1. ROUGE-1 — пересечение униграмм, то есть отдельных слов.
2. ROUGE-2 — пересечение биграмм, или пар слов.
3. ROUGE-L — совпадение на основе наиболее длинной общей подпоследовательности, LCS.
ROUGE-1 отвечает на простой вопрос: сохранились ли основные слова и понятия. ROUGE-2 лучше учитывает локальные связи между словами. ROUGE-L смотрит на более протяженное сходство последовательностей, но не требует полного совпадения каждого фрагмента.
Для новостного дайджеста ROUGE полезна при проверке покрытия. Если эталонное резюме содержит событие, дату, участника и последствие, низкий recall может указывать, что часть содержания исчезла. Это особенно заметно в длинных исходных текстах, где модель выбирает только один аспект новости.
Однако у ROUGE есть системное ограничение. Метрика не знает, какие слова являются критическими. Потеря второстепенной детали и потеря отрицания могут влиять на результат несопоставимым образом, хотя сама метрика этого не различает.
Сценарий:
- эталон содержит формулировку о том, что поставки не возобновились;
- модель пишет, что поставки возобновились;
- большая часть слов может совпасть;
- ROUGE будет фиксировать сходство, но не логическую инверсию.
Поэтому ROUGE нельзя использовать как автоматическую проверку достоверности. Это инструмент оценки пересечения и покрытия, а не фактчекер.
Как читать ROUGE в тестировании суммаризатора
Низкий ROUGE-1 обычно означает, что генерация использует другую лексику либо пропускает значимую часть содержания. Низкий ROUGE-2 может указывать на расхождение в формулировках и связях между словами. Низкий ROUGE-L — на заметное отличие структуры и последовательности изложения.
Но интерпретация зависит от типа суммаризации:
- экстрактивная суммаризация выбирает фрагменты из исходника, поэтому лексические метрики здесь обычно информативнее;
- абстрактивная суммаризация переформулирует содержание, поэтому низкий ROUGE не обязательно означает плохой результат;
- многоязычная суммаризация дополнительно усложняет сравнение из-за различий в морфологии и синтаксисе;
- короткие новости дают мало токенов для устойчивого сравнения, поэтому отдельные совпадения сильнее влияют на результат.
В рабочем наборе ROUGE лучше применять не как абсолютную границу качества, а как средство сравнения версий одной системы. Если меняется промпт, модель или стратегия постобработки, динамика ROUGE помогает увидеть, стало ли покрытие эталона лучше. Она не заменяет анализ ошибок.
ROUGE измеряет, сколько содержания похоже на эталон. Он не определяет, правильно ли это содержание понято.
BERTScore: смысловая близость вместо буквального совпадения
BERTScore использует контекстные векторные представления моделей семейства BERT. Вместо жесткого сопоставления одинаковых слов метрика сравнивает эмбеддинги токенов и вычисляет косинусное сходство. За счет этого учитываются синонимы, словоформы и перефразирование.
Для суммаризации это существенный сдвиг. Саммари может использовать другую конструкцию, но сохранить смысл. Например, исходная формулировка сообщает о снижении расходов, а генерация — о сокращении затрат. Лексическое совпадение ограничено. Семантическое сходство остается высоким.
BERTScore обычно рассматривают через precision, recall и F1:
- precision показывает, насколько элементы сгенерированного текста согласуются с эталоном;
- recall отражает, насколько содержание эталона покрыто генерацией;
- F1 объединяет оба направления.
Такая структура удобна для диагностики. Низкий recall может означать неполный пересказ. Низкий precision — наличие лишних или нерелевантных утверждений. Но это только вероятностная интерпретация. Метрика не выдает юридического заключения о каждом факте.
Семантическое сходство создает риск ложной уверенности. Ошибочная фраза может оставаться близкой к исходной по векторному представлению. Особенно это касается:
- чисел и процентов;
- дат;
- имен собственных;
- географических названий;
- отрицаний;
- модальных конструкций;
- статуса решения;
- условных формулировок.
Фраза о том, что компания может сократить штат, и фраза о том, что компания сократила штат, семантически связаны. Для редактора это разные сообщения. BERTScore может не дать достаточного сигнала о подобном расхождении.
Где BERTScore оправдан
Метрика подходит для сравнения абстрактивных саммари, особенно когда существует несколько допустимых способов пересказа. Она полезнее BLEU и ROUGE в ситуациях, где авторская переформулировка считается нормой.
В оценке новостного дайджеста BERTScore может отвечать на вопрос о сохранении общей смысловой рамки:
- не ушла ли модель в другую тему;
- сохранена ли связь между событием и его результатом;
- передан ли основной предмет новости;
- не добавлены ли утверждения, которых в эталоне нет.
Но для публикационного контура требуется дополнительная пословная или структурная проверка. Отдельно сравниваются числа, даты, названия организаций и глаголы, определяющие статус события. Семантическая метрика должна быть одним слоем контроля, а не финальным арбитром.
METEOR: гибкое сопоставление с эталоном
METEOR относится к метрикам, которые расширяют простое совпадение слов. Она учитывает не только точные совпадения, но и словоформы, стемминг, синонимические соответствия и порядок элементов. В основе лежит баланс между precision и recall, дополненный штрафом за фрагментированное совпадение.
Это делает METEOR промежуточным вариантом между жестко лексическими и семантическими подходами. Метрика терпимее к грамматическим изменениям и перефразированию, чем BLEU. При этом она остается привязана к конкретному эталону и к доступным правилам сопоставления.
Для русского языка проблема усложняется морфологией. Одинаковое содержание может быть выражено разными падежами, числами и синтаксическими конструкциями. Если языковые ресурсы и нормализация работают плохо, результат будет зависеть не от качества саммари, а от качества предварительной обработки.
METEOR полезна в трех случаях:
- когда нужно учитывать словоформы;
- когда в корпусе много допустимых синонимических замен;
- когда требуется дополнить ROUGE более гибким лексическим сравнением.
При этом она не решает проблему фактической корректности. Система может подобрать правильные синонимы к ошибочному утверждению. Если исходник говорит о планах, а саммари — о завершенном действии, совпадение слов и смысловая близость не отменяют ошибку.
METEOR также не следует использовать как универсальный показатель между разными языками и доменами без калибровки. Медицинский, финансовый и политический тексты имеют разную цену ошибки. В финансовом сообщении одно число может быть важнее всего остального текста. В политической новости критичным становится субъект и статус решения. Одна и та же итоговая оценка не означает одинаковый редакционный риск.
G-Eval: LLM-судья вместо фиксированного эталона
G-Eval — фреймворк оценки текста на базе LLM-as-a-judge. Он использует естественно-языковые инструкции и цепи рассуждений для оценки таких параметров, как связность, полнота, беглость и релевантность. В отличие от BLEU и ROUGE, G-Eval не требует строгого совпадения с единственным референсом.
В оригинальной работе G-Eval с GPT-4 показал среднюю корреляцию Спирмена 0,514 с человеческими оценками в задачах суммаризации. Это выше результатов прежних автоматических метрик в описанном сравнении, но число не является универсальной гарантией. Корреляция относится к конкретной постановке, набору данных, критериям и модели-судье.
G-Eval можно настроить под редакционную задачу. Например, модель-судья получает:
- исходную новость;
- сгенерированное саммари;
- список критериев;
- шкалу оценки;
- указание отдельно фиксировать пропуски и добавленные факты.
Такой подход ближе к реальной редакторской проверке. Он способен оценивать не только совпадение слов, но и связность изложения, релевантность деталей и полноту передачи основной мысли.
Однако LLM-судья не превращается от этого в независимый источник истины. У него есть собственные ограничения:
- зависимость от формулировки промпта;
- чувствительность к порядку и форме входных данных;
- возможная склонность предпочитать гладкий текст фактически точному;
- нестабильность оценок при повторных запусках;
- риск соглашаться с убедительно сформулированной ошибкой;
- зависимость результата от выбранной модели.
В оценке новостных дайджестов G-Eval следует заставлять судью работать по отдельным осям, а не выдавать общий балл. Минимальный набор:
1. Сохранение фактов. Не изменены ли числа, даты, субъекты и статусы событий.
2. Полнота. Переданы ли ключевые элементы новости.
3. Релевантность. Нет ли деталей, не связанных с основной темой.
4. Связность. Не разрушены ли причинные и временные связи.
5. Галлюцинации. Есть ли утверждения, отсутствующие в исходном тексте.
6. Краткость. Убраны ли второстепенные сведения без потери смысла.
Важен порядок. Сначала проверяются факты и добавленные утверждения. Затем — полнота и структура. Беглость должна иметь меньший вес, чем достоверность. Иначе модель-судья начнет вознаграждать литературную гладкость.
LLM-судья оценивает текст по заданным правилам. Качество этих правил определяет значительную часть результата.
Почему автоматические метрики не обнаруживают все галлюцинации
Галлюцинация — не обязательно бессвязная или очевидно чужая фраза. Часто это правдоподобное изменение детали. Модель сохраняет общий контекст, использует правильные термины и строит грамматически корректное предложение. Ошибка появляется в одном параметре.
Для новостного саммари критичны следующие классы искажений:
- замена предполагаемого события на состоявшееся;
- изменение числа, валюты или единицы измерения;
- перестановка причины и следствия;
- перенос действия с одной организации на другую;
- потеря отрицания;
- смешение даты публикации и даты события;
- превращение комментария в официальное решение;
- добавление вывода, которого нет в исходном материале.
Ни BLEU, ни ROUGE, ни BERTScore, ни METEOR не имеют встроенного надежного механизма для полного обнаружения таких ошибок. Они сравнивают текст с эталоном или оценивают сходство. Если ошибка остается близкой к исходному содержанию, итоговый балл может выглядеть приемлемо.
G-Eval способен выявить часть подобных расхождений, если критерии сформулированы точно и судья получает исходный текст. Но и здесь нельзя считать результат доказательством. Для важных материалов нужна проверка по атомарным утверждениям.
Проверка по атомарным утверждениям
Исходную новость разбивают на минимальные факты:
- кто совершил действие;
- какое действие совершено;
- когда это произошло;
- где произошло;
- в каком объеме;
- при каких условиях;
- чем действие завершилось;
- какой статус имеет информация.
Затем каждый факт сопоставляется с саммари. Возможны четыре результата:
- факт передан корректно;
- факт пропущен;
- факт искажен;
- добавлен факт без опоры на исходник.
Такая разметка требует больше ресурсов, чем расчет ROUGE. Но она ближе к реальному редакционному риску. Для короткого новостного дайджеста несколько проверенных утверждений часто полезнее одного общего балла качества.
Нельзя смешивать пропуск второстепенной детали и искажение ключевого числа в единую безымянную оценку. У них разная цена ошибки. Система тестирования должна учитывать веса фактов.
Как выбрать стратегию оценки для новостного дайджеста
Универсальной метрики нет. Рабочая стратегия зависит от того, что именно требуется контролировать: близость к эталону, полноту, перефразирование, отсутствие лишних утверждений или публикационный риск.
Если эталонных саммари много
Используются ROUGE, BLEU, METEOR и BERTScore. Несколько эталонов снижают зависимость от одной формулировки. Лексические метрики получают более устойчивую базу. BERTScore лучше отражает допустимые перефразы.
В такой конфигурации показатели стоит рассматривать совместно:
- ROUGE показывает покрытие распространенных формулировок;
- BLEU — точность совпадения и влияние длины;
- METEOR — гибкость лексического соответствия;
- BERTScore — семантическую близость.
При этом среднее арифметическое четырех метрик не создает объективный рейтинг. Оно лишь скрывает различия между ними. Сначала анализируется профиль ошибок, затем выбирается показатель, соответствующий задаче.
Если эталонного саммари нет
Можно использовать G-Eval с исходным текстом и формализованной рубрикой. Но результат следует калибровать на части набора, которую проверили люди. Без такой калибровки шкала судьи остается условной.
Для регулярного мониторинга применяется смешанная схема:
- G-Eval для связности, полноты и релевантности;
- отдельное извлечение чисел, дат и имен;
- ручная проверка выборки;
- сравнение ошибок между версиями модели.
Система без референса не должна выдавать видимость точности до сотых долей. Детализированное число не делает оценку надежнее.
Если саммари публикуется без редактора
Требования становятся жестче. Оценка полноты недостаточна. Нужна процедура блокировки публикации при расхождении по критичным полям.
Практический набор контролей:
- совпадение чисел и единиц измерения;
- совпадение дат и временных интервалов;
- сохранение отрицаний;
- проверка имен и организаций;
- сверка модальных глаголов и статуса события;
- поиск утверждений, которых нет в исходнике;
- проверка максимальной длины и обязательных полей.
Автоматические метрики в этой схеме используются для мониторинга, а не для единоличного разрешения публикации.
Минимальная матрица тестирования
Для нового суммаризатора разумно разделить тестовый набор по типам риска:
- короткие новости с одной фактической деталью;
- материалы с несколькими числами;
- сообщения с отрицаниями и условиями;
- тексты с несколькими участниками;
- новости с хронологией событий;
- тексты, где факт и комментарий находятся рядом;
- длинные статьи с несколькими сюжетными линиями.
Для каждого типа фиксируются разные показатели. В материалах с числами важнее точность извлеченных значений. В хронике — порядок событий. В аналитических текстах — сохранение оговорок и причинных связей.
Что сравнивать между версиями модели
Сравнивать только средний балл неэффективно. Он может вырасти за счет простых текстов, пока сложные новости станут обрабатываться хуже.
Сравнение должно включать:
- медианное значение по каждому классу материала;
- долю критических фактических ошибок;
- среднюю длину саммари;
- количество добавленных утверждений;
- долю пропущенных ключевых фактов;
- стабильность результатов при повторном запуске;
- распределение ошибок по типам.
Медианное значение полезнее среднего, если несколько выбросов создают непропорциональное влияние. Для редакционного процесса критична не только типичная генерация, но и хвост редких тяжелых ошибок.
Рекомендуемая комбинация метрик
Для первичного технического сравнения подойдет связка ROUGE и BERTScore. ROUGE покажет покрытие референса, BERTScore — устойчивость к перефразированию. METEOR добавит более гибкое лексическое сопоставление. BLEU имеет смысл оставить как вспомогательный показатель, особенно при сравнении систем с близкой длиной и шаблонной подачей.
Для оценки без жесткого эталона добавляется G-Eval. Его следует запускать по нескольким критериям, а не просить вывести одно впечатление о качестве. Отдельно задаются правила для чисел, дат, имен, отрицаний и неподтвержденных утверждений.
Итоговая архитектура выглядит так:
1. Лексический слой: ROUGE, BLEU, METEOR.
2. Семантический слой: BERTScore.
3. Оценка по рубрике: G-Eval.
4. Фактический слой: сравнение атомарных утверждений и критичных сущностей.
5. Человеческий контроль: выборка материалов с учетом класса риска.
Первые три слоя дают измеримость. Четвертый снижает риск смысловых искажений. Пятый нужен для проверки того, что вся система не оптимизируется под формальные показатели в ущерб редакционному результату.
Вердикт
Для оценки качества суммаризации текста метрики нельзя сводить к единому рейтингу. BLEU и ROUGE измеряют лексическое совпадение, причем ROUGE ориентирована на полноту, а BLEU — на точность n-грамм с учетом штрафа за краткость. METEOR делает сопоставление гибче. BERTScore лучше работает с перефразированием и смысловой близостью. G-Eval позволяет оценивать текст по редакционным критериям без единственного эталонного резюме.
Но ни одна из пяти метрик не гарантирует отсутствие галлюцинаций. Для новостного дайджеста финальным критерием остаются сохранение фактов, корректный статус события и отсутствие добавленных утверждений.
Однозначная рабочая схема: ROUGE или METEOR для покрытия, BERTScore для семантики, G-Eval для структурной оценки и отдельная проверка атомарных фактов. Всё остальное — вспомогательная статистика.