增量命名实体识别(INER)是让 AI 在持续学习新类型实体的同时不丢失旧类型识别能力的任务。一项 2026 年 8 月底发布在 arXiv 上、并已被 IEEE 人工智能汇刊(IEEE Transactions on Artificial Intelligence)接收的研究发现:新训练数据中的「上下文偏见」会明显加速模型对旧知识的遗忘,并提出了名为 TBCL(类型平衡上下文学习)的解法。这项研究聚焦的是模型越学新东西越忘旧东西的原因与对策——AI 学新忘旧,未必全是模型结构的错,训练数据本身的构造方式同样关键。

实体识别:让 AI 认出文本里的专有名词

命名实体识别(NER)是自然语言处理中的基础任务:从一段文字里找出人名、地名、机构名等专有名词。比如在「张伟在杭州的阿里巴巴上班」这句话里,模型要认出「张伟」是人名、「杭州」是地名、「阿里巴巴」是机构名。它是搜索引擎、客服机器人、内容理解等应用的底层能力。

现实世界的实体类型在不断增多:新公司、新产品、新地名、新药名……模型不能每次遇到新类型就从头训练,于是有了「增量」需求——在已有能力的基础上,持续学会识别新类型。

增量学习的两大难关

增量命名实体识别(INER)主要面对两个挑战。

第一个是灾难性遗忘:模型为了学习新类型而调整自身参数时,会把识别旧类型所需的能力「冲掉」。这是持续学习领域的老问题。

第二个是「非实体」语义偏移:文本中大量词语并不是实体(比如「今天」「公司」「发布」),属于「非实体」类别。随着新领域数据不断加入,这些非实体词的含义与用法环境会悄悄变化,干扰模型对「什么算实体」的判断。

伪标签方法:一个被忽视的问题

为了减少人工标注成本,业界常用「伪标签」训练:先用已有模型给新文本自动打上标签,再用这些机器标注的数据继续训练模型。这种方法在 INER 上确实有效,但研究者发现它附带一个此前没人注意的问题——有偏上下文(biased context)。

论文的分析表明:在新句子里,代表旧实体类型的词元(token,文本切分后的最小单位,大致相当于一个词或半个词)与上下文的关联,会显著偏向新实体类型;相比之下,它们在旧句子中的上下文则没有这种偏向。具体表现是,新数据里的旧类型词,经常和新类型的语境「混在一起」,模型反复看到这种组合,就会把旧知识往新类型上带。

结果两头受损:旧知识加速退化,新知识则过度拟合——模型把训练数据里的局部模式死记下来,换一批真实数据就表现变差。

TBCL 解法:给上下文配平

针对这个问题,研究者提出了类型平衡上下文学习(Type-Balanced Contextual Learning,TBCL),包含两个部件:

  • 句子对学习方案(sentence-duplet learning scheme):把新句子与旧句子配对,让模型同时接触新、旧两类上下文,避免只被新语境的偏向主导;
  • 上下文一致性损失(contextual consistency loss):约束同一个词在不同上下文中的表示保持一致,防止旧类型词的语义被新语境带偏。

研究在 3 个公认数据集、10 组 INER 设置上验证了 TBCL 的效果,结果支持该方法能有效缓解有偏上下文带来的遗忘问题。

这项研究的意义

这件事的意义不止于一个模型方法:它提醒行业,AI 学新忘旧,未必全是模型结构的问题,训练数据的构造方式同样关键。对任何需要模型持续学习新知识的实际系统——搜索引擎索引、客服助手、内容审核——「先检查数据里的上下文配比」都是一个可直接落地的新思路。

结论是:想要模型学新而不忘旧,除了改进算法,还要回头检查训练数据——旧类型词与新语境混搭导致的上下文偏见,是加速遗忘的重要诱因;通过句子配对与一致性约束把两类上下文配平,是缓解遗忘的可行路径。