1. PEGASUS模型概述
PEGASUS(Pre-training with Extracted Gap-sentences for Abstractive Summarization)是Google Research在2020年提出的专门针对文本摘要任务的预训练语言模型。与传统的通用预训练模型不同,PEGASUS从设计之初就聚焦于解决摘要生成这一特定任务的核心挑战。
在自然语言处理领域,摘要任务通常分为抽取式(extractive)和生成式(abstractive)两种。前者直接从原文中选取重要句子组成摘要,后者则需要理解全文后重新组织语言生成摘要。PEGASUS的创新之处在于,它通过精心设计的预训练目标——Gap Sentences Generation(GSG),使模型在预训练阶段就掌握了生成高质量摘要的核心能力。
提示:PEGASUS的成功证明,针对特定任务设计的预训练目标比通用预训练+微调的方式更能发挥模型潜力。
1.1 传统方法的局限性
在PEGASUS出现之前,摘要任务主要面临两大挑战:
-
数据依赖问题:监督式摘要模型需要大量"文章-摘要"配对数据,而这类数据的标注成本极高。以CNN/Daily Mail数据集为例,人工撰写一篇新闻摘要平均需要5-10分钟专业时间。
-
目标偏移问题:通用预训练模型(如BERT、GPT等)的预训练目标(如掩码语言建模)与摘要任务的最终目标存在明显差距。这导致模型在微调时需要"重新学习"摘要能力。
我曾在实际项目中使用BERT微调进行摘要生成,发现模型倾向于复制原文片段而非生成凝练摘要。这种"复制粘贴"行为正是预训练与下游任务目标不一致的典型表现。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心创新:Gap Sentences Generation
2.1 GSG机制详解
GSG(Gap Sentences Generation)是PEGASUS的灵魂所在。其核心思想可以概括为:通过预测被删除的重要句子来模拟摘要生成过程。具体实现分为三个关键步骤:
- 重要性评分:对文档中的每个句子计算重要性得分。论文中采用了三种策略:
- Random:随机选择句子
- Lead:选择开头的句子(新闻类文章常用)
- Principal:基于ROUGE分
