arXiv 2005.14165 的首发日期是 2020 年 5 月 28 日。论文标题是 Language Models are Few-Shot Learners。作者团队来自 OpenAI。文中把 GPT-3 写成 1750 亿参数的自回归语言模型,并写它大约是此前非稀疏语言模型的十倍。这个整数是论文自己写的,不是后来媒体估算。
他们要证明的不是「再微调一次就刷榜」。正文反复讲:把模型做大之后,很多任务可以只靠提示词和几个例子完成,不必每次准备几千条标注。论文把这种用法叫 few-shot,零条例子叫 zero-shot。同时它也列出仍然做不好的数据集,以及从网页语料里带来的偏见和方法问题。读摘要只看「1750 亿」会漏掉后半段。
API 并不是论文挂上的同一秒对全世界开放。OpenAI 后来用申请制放出 GPT-3 接口,再分批扩容。能钉在 5 月 28 日的,是预印本进入公开库。参数量、训练计算和评测表,以论文表格为准。不要把后来某个 API 型号的价格抄回这一天。
2022 年 11 月 30 日的 ChatGPT,用的是 GPT-3.5 家族再加人类反馈强化学习,不是把这篇论文的原始模型直接塞进聊天窗。两条线要分开:2020 年 5 月是「大模型可以少样本干活」被写成论文;2022 年 11 月是「普通人打开浏览器就能接着聊」。中间还有 InstructGPT 那条对齐线。
这篇论文之后,实验室和创业公司开始把「先做大、再靠提示词」当成默认假设。它没有宣布对话产品,也没有公布完整训练数据清单。能核对的是日期、标题和 1750 亿这个自报数字。
