打开 arXiv 1810.04805,提交日期是 2018 年 10 月 11 日。标题是 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding。作者来自谷歌。BERT 是两个方向的 Transformer 编码器:预训练时随机挡住一些词,让模型根据左右上下文把它们猜回来,另外还有一句「下一句是否接得上」的任务。
和同年已经出现的 GPT 路线不同。GPT 是从左往右生成;BERT 是把整句双方向读完,再接到具体任务上微调。论文强调:很多任务不必再为每个数据集重做一套结构,加一层输出就够。GLUE、SQuAD 那些公开榜,当时被它刷了一轮。
2018 年没有对话产品从这篇论文里直接长出来。它改的是工业界做分类、检索和问答的默认工序:先在大批量文本上预训练,再拿小标注集微调。后来的 RoBERTa、中文 BERT 变体,都是这条工序的亲戚。生成式大模型走的是另一条解码器路,但「先预训练再对齐」的习惯,和 BERT 是同一类思路。
日期钉在 arXiv 首发。NAACL 2019 才是会议正式发表。谷歌后来把 BERT 用进搜索,那是分市场滚动的工程,不是 10 月 11 日全球开关。开源实现和模型卡随后出现在 GitHub 和 TensorFlow Hub,下载日不等于论文日。
不要把 BERT 读成 ChatGPT 的前身。它不生成长对话,它给句子一个双向表示,再接到分类或问答头上。和 GPT-3 的「提示词少样本」是两条工序。能核对的是 arXiv 编号、作者和 NAACL 正式文本。
