VASTOCE
RSS
行情
正在读取公开行情
人工智能

2018 年 10 月 11 日:BERT 论文把双向 Transformer 写成可微调的底座

2018 年 10 月 11 日,谷歌的 BERT 论文出现在 arXiv。它用掩码语言模型从左右两边一起读句子,再加一层就能微调到问答和推理。后来几年搜索和分类系统大量站在这条预训练—微调的路上。

1 分钟阅读 Vastoce

打开 arXiv 1810.04805,提交日期是 2018 年 10 月 11 日。标题是 BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding。作者来自谷歌。BERT 是两个方向的 Transformer 编码器:预训练时随机挡住一些词,让模型根据左右上下文把它们猜回来,另外还有一句「下一句是否接得上」的任务。

和同年已经出现的 GPT 路线不同。GPT 是从左往右生成;BERT 是把整句双方向读完,再接到具体任务上微调。论文强调:很多任务不必再为每个数据集重做一套结构,加一层输出就够。GLUE、SQuAD 那些公开榜,当时被它刷了一轮。

2018 年没有对话产品从这篇论文里直接长出来。它改的是工业界做分类、检索和问答的默认工序:先在大批量文本上预训练,再拿小标注集微调。后来的 RoBERTa、中文 BERT 变体,都是这条工序的亲戚。生成式大模型走的是另一条解码器路,但「先预训练再对齐」的习惯,和 BERT 是同一类思路。

日期钉在 arXiv 首发。NAACL 2019 才是会议正式发表。谷歌后来把 BERT 用进搜索,那是分市场滚动的工程,不是 10 月 11 日全球开关。开源实现和模型卡随后出现在 GitHub 和 TensorFlow Hub,下载日不等于论文日。

不要把 BERT 读成 ChatGPT 的前身。它不生成长对话,它给句子一个双向表示,再接到分类或问答头上。和 GPT-3 的「提示词少样本」是两条工序。能核对的是 arXiv 编号、作者和 NAACL 正式文本。

常见问题

和 Transformer 原文是一篇吗?

不是。Transformer 是 2017 年。BERT 用它的编码器做双向预训练。

和 GPT 谁先谁后?

GPT-1 的报告在 2018 年 6 月。BERT 是 10 月。路线不同。

会议论文是哪一年?

NAACL 2019。预印本是 2018 年 10 月 11 日。

参考资料

  1. arXiv — BERT
  2. ACL Anthology — NAACL 2019 正式文本

本站作者做的阅读器

Kite RSS

用 Kite RSS 订一份自己的时间线

本站的文章会进订阅源。你也可以把别的公开源放进去,在自己的设备上读,不经过推荐流。