VASTOCE
RSS
行情
正在读取公开行情
人工智能

2020 年 5 月 28 日:GPT-3 论文把 1750 亿参数写进公开记录

2020 年 5 月 28 日,OpenAI 把《Language Models are Few-Shot Learners》挂上 arXiv。文中的 GPT-3 有 1750 亿参数,强调不微调、只靠提示词和少量例子就能做很多任务。这是后来对话产品的模型底座之一。

1 分钟阅读 Vastoce

arXiv 2005.14165 的首发日期是 2020 年 5 月 28 日。论文标题是 Language Models are Few-Shot Learners。作者团队来自 OpenAI。文中把 GPT-3 写成 1750 亿参数的自回归语言模型,并写它大约是此前非稀疏语言模型的十倍。这个整数是论文自己写的,不是后来媒体估算。

他们要证明的不是「再微调一次就刷榜」。正文反复讲:把模型做大之后,很多任务可以只靠提示词和几个例子完成,不必每次准备几千条标注。论文把这种用法叫 few-shot,零条例子叫 zero-shot。同时它也列出仍然做不好的数据集,以及从网页语料里带来的偏见和方法问题。读摘要只看「1750 亿」会漏掉后半段。

API 并不是论文挂上的同一秒对全世界开放。OpenAI 后来用申请制放出 GPT-3 接口,再分批扩容。能钉在 5 月 28 日的,是预印本进入公开库。参数量、训练计算和评测表,以论文表格为准。不要把后来某个 API 型号的价格抄回这一天。

2022 年 11 月 30 日的 ChatGPT,用的是 GPT-3.5 家族再加人类反馈强化学习,不是把这篇论文的原始模型直接塞进聊天窗。两条线要分开:2020 年 5 月是「大模型可以少样本干活」被写成论文;2022 年 11 月是「普通人打开浏览器就能接着聊」。中间还有 InstructGPT 那条对齐线。

这篇论文之后,实验室和创业公司开始把「先做大、再靠提示词」当成默认假设。它没有宣布对话产品,也没有公布完整训练数据清单。能核对的是日期、标题和 1750 亿这个自报数字。

常见问题

1750 亿是谁说的?

论文自己写的。不是本站估算。

和 ChatGPT 是同一个模型吗?

不是。ChatGPT 基于后续的 GPT-3.5 并对齐训练。

哪一天可以随便调用 API?

论文日不等于全面开放日。接口是后来分批开放的。

参考资料

  1. arXiv — Language Models are Few-Shot Learners
  2. OpenAI — GPT-3 相关说明(论文同期博客)

本站作者做的阅读器

Kite RSS

用 Kite RSS 订一份自己的时间线

本站的文章会进订阅源。你也可以把别的公开源放进去,在自己的设备上读,不经过推荐流。