Экстрактивные и абстрактивные суммаризаторы: главные отличия
Выбор метода сжатия текста определяется не удобством интерфейса, а допустимым уровнем фактического риска. Экстрактивный суммаризатор работает как маркер на полях документа: выделяет готовые предложения и собирает из них сокращённую версию.

Экстрактивная и абстрактивная суммаризация: главные отличия
Абстрактивный метод действует как автор, переписывающий исходник: генерирует новые формулировки, которых в оригинале нет. Разница между подходами — не вопрос стиля, а вопрос доверия к выходному тексту.
Экстрактивный метод исключает риск галлюцинаций. Абстрактивный метод исключает рваный синтаксис. Идеального решения нет — есть компромисс между точностью и читабельностью.
Механика экстрактивного подхода
Экстрактивная суммаризация извлекает наиболее значимые предложения или фразы непосредственно из исходного текста в неизменном виде. Алгоритм не переписывает формулировки — он ранжирует готовые блоки и склеивает верхние из них в новом порядке.
Принцип работы:
- Текст разбивается на предложения или более мелкие единицы.
- Каждый блок оценивается по весу: частота терминов, положение в документе, плотность смысловых маркеров.
- Топ-N блоков выводится в итоговый дайджест без редактирования.
Реализуется через алгоритмы TextRank (графовая модель на базе PageRank), SumBasic и библиотеки Sumy, Gensim. TextRank строит граф предложений, где ребра означают лексическую близость, и итеративно рассчитывает вес каждого узла. Метод детерминирован: на одном и том же входе результат воспроизводим, а каждое слово в выходном тексте присутствует в источнике.
Преимущество — высокая фактическая достоверность. Снижение качества — в логической связности: выдернутые из контекста предложения нередко конфликтуют по временам или ссылкам. Для новостной ленты, где важна юридическая и числовая точность, экстрактивный метод остаётся стандартом.
Абстрактивная суммаризация: порождение нового текста
Абстрактивная суммаризация генерирует краткое содержание с порождением нового текста, содержательно обобщающего первичный документ. Метод может включать слова, отсутствующие в оригинале. Это не копирование, а пересказ — с изменением структуры, заменой синонимами, слиянием нескольких предложений в одно.
Основа подхода — трансформерные Seq2Seq-модели: BART (Facebook AI), T5 (Google), Pegasus (модель с маскированием предложений), а также генеративные LLM общего назначения. Модель получает исходный текст как контекст и формирует сжатую версию авторегрессионно — токен за токеном.
Ключевое свойство абстрактивного выхода — гладкость. Текст читается как авторская редакция, а не как набор вырезок. Это критично для презентаций, маркетинговых материалов, контентных пересказов, где восприятие важнее буквальной точности.
Недостаток — отсутствие гарантии верности исходным данным. Генеративная модель опирается на вероятностное распределение токенов, а не на поиск по тексту.
Галлюцинации и фактическая точность
Основной риск абстрактивной суммаризации на базе LLM — генерация галлюцинаций: искажение чисел, добавление деталей, которых не было в исходном контексте. Модель способна сгенерировать корректно оформленную фразу с фактически ложным содержимым — датой, суммой, именем.
Примеры типовых сбоев:
- Замена числового значения на близкое по контексту, но иное по сути (рост «на 12%» превращается в «рост на 21%»).
- Подстановка вымышленного участника события или цитаты.
- Сглаживание противоречий между двумя источниками в один ложный консенсус.
В юридических, медицинских и финансовых доменах экстрактивный подход часто предпочтительнее из-за полного отсутствия этого риска. Там, где цена фактической ошибки измеряется деньгами или ответственностью, выходной текст обязан быть дословной компиляцией источника.
Абстрактивный суммаризатор повышает читабельность, но снижает верифицируемость. Экстрактивный — наоборот.
Технологический стек и инструменты
Выбор инструментария зависит от требований к скорости, объёму и качеству.
| Параметр | Экстрактивный стек | Абстрактивный стек |
|---|---|---|
| Алгоритмы / модели | TextRank, LexRank, SumBasic, LSA | BART, T5, Pegasus, GPT-серия |
| Библиотеки и фреймворки | Sumy, Gensim, spaCy | Hugging Face Transformers, PyTorch |
| Ресурсоёмкость | Низкая, работает на CPU | Высокая, требует GPU или API |
| Контроль над результатом | Полный — каждое слово из источника | Частичный — выход не детерминирован |
| Риск искажений | Минимальный | Значимый, требует пост-валидации |
| Типовая задача | Юридические выжимки, новостные дайджесты | Контентные пересказы, обзоры литературы |
Экстрактивный стек дешевле в эксплуатации и проще в аудите. Абстрактивный требует инфраструктуры для инференса и процессов проверки результата перед публикацией.
Метрики оценки качества
Сравнение суммаризаторов ведётся по двум классам метрик.
ROUGE (Recall-Oriented Understudy for Gisting Evaluation) — семейство метрик, сравнивающих N-граммы выходного текста с эталоном. ROUGE-N измеряет совпадение последовательностей слов, ROUGE-L учитывает длину общих подпоследовательностей. Метрика работает на лексическом уровне и не различает формулировки с тем же смыслом.
BERTScore — современная семантическая метрика на базе эмбеддингов. Сравнивает не строки, а векторные представления слов, что позволяет учитывать синонимы и перефразирования. BERTScore точнее отражает смысловое совпадение, но уступает ROUGE в интерпретируемости.
На практике применяют обе метрики одновременно: ROUGE фиксирует дословную близость, BERTScore — смысловую. Ни одна из них не измеряет галлюцинации напрямую — для этого нужна ручная разметка или отдельная factuality-метрика (FactCC, QAGS).
Что выбрать под конкретную задачу
Решение определяется тремя параметрами: доменом, объёмом трафика и допустимым уровнем ручной проверки.
- Новостной дайджест с жёсткими требованиями к цифрам и именам — экстрактивный метод. Любая ошибка публична и юридически значима.
- Контентный пересказ для блога или рассылки, где важна гладкость чтения — абстрактивный, с пост-редактурой.
- Юридический или медицинский обзор — экстрактивный, с возможной ручной склейкой для связности.
- Массовая генерация описаний карточек товаров — абстрактивный, с автоматической factuality-проверкой.
Универсального превосходства одного подхода над другим нет. Экстрактивный метод выигрывает по точности и стоимости. Абстрактивный — по читабельности и адаптивности. Гибридные схемы (сначала экстракция, затем абстрактивная переработка отобранных блоков) применяются в продакшене, но не снимают риск галлюцинаций на втором этапе.
Итог: при высокой цене фактической ошибки выбор предопределён — экстракция. Там, где важна форма подачи, а проверка заложена в процесс, абстрактивный метод оправдан.