1. 城镇大全网
  2. 综合百科

人工预测和ai预测(史上最大AI模型GPT-3上线:不仅会写文)

机器心脏报告

机器之心编辑部

时隔一年,OpenAI发布的预训练语言模型GPT-3再次令人印象深刻。

“我们训练了GPT-3,这是一个自回归语言模型,有1750亿个参数,比以前的任何非稀疏语言模型都多10倍。我们在少拍的情况下测试了它的性能。」

本周五,OpenAI提出的GPT-3在社交网络上掀起了新的浪潮。它的参数比2月份刚刚推出的全球最大深度学习模型图灵NLP大十倍,不仅能更好地回答问题、翻译和写文章,还具备一定的数学计算能力。如此强大的深度学习不禁给人一种错觉:真正的AI来了吗?

首先,GPT-3最令人惊讶的是模型体积。它使用的最大数据集在处理前有45TB的容量。根据OpenAI的计算能力统计单位petaflops/s-days,训练AlphaGoZero需要1800-2000 PFS-days,而OpenAI刚刚提出的GPT-3需要3640 PFS-days。看来微软无限计算能力的OpenAI现在真的是为所欲为了。

研究人员希望GPT-3能成为更通用的NLP模型,解决当前BERT等模型的两个缺点:对域内标记数据的过度依赖和对域内数据分布的过度拟合。GPT-3致力于能够使用更少的特定领域,无需微调就能解决问题。

和往常一样,GPT-3马上发布了GitHub项目页面,但目前只是一些生成的样本和数据集,没有代码:https://github.com/openai/gpt-3.

不过上传没那么快也是可以理解的。在这个问题上,有人说出了真相:参数太多了。如果GPT-25亿参数等于6G,GPT-3型号可能要700G,老硬盘加载不了,不是正常人玩的。

2019年3月,机器学习的先驱、阿尔伯塔大学教授理查德·萨顿(Richard S. Sutton)在他的著名文章《惨痛的教训》的开头说:“人工智能研究的70年历史告诉我们,使用计算能力的一般方法最终是最有效的方法。」

GPT-3的提出,可能让研制人员落泪,大学老师沉默,黄仁勋感觉肩上的担子更重了。还记得几周前刚刚结束的GTC 2020吗,英伟达CEO的主题演讲上有一页是关于近年来人工智能领域最大的深度学习模型的:

英伟达表示,自2017年底特斯拉V100发布以来,训练最大型号的计算能力需求增长了3000倍。在这种情况下,GPT 2号不再处于最高位置。微软今年2月推出的图灵NLG(1700亿参数)和英伟达的威震天-伯特(80亿参数)位居前列。GPT-3应该放在这个表中,刻度表应该上移一点。

另一位网友抱怨GPT三号72页的论文长度也令人绝望:

下一个更大的型号恐怕纸的长度不会超过100。

不过庞大的参数带来的文本生成效果也是相当可观的。让我们看看GPT 3号能否实现写新闻、小说甚至论文的能力。

GPT-3:我是GPT-2的极端进化版。

2019年初,OpenAI发布了通用语言模型GPT-2,可以生成连贯的文本段落,并在多项语言建模基准上取得SOTA性能。这个基于Transformer的大规模语言模型包含15亿个参数,在800万个网页数据集上进行训练。GPT-2是GPT模型的直接扩展,它是在10倍以上的数据上训练的,有10倍以上的参数。

然而长江后浪推前浪。昨天,OpenAI发布了具有1750亿个参数的GPT-3模型,是GPT-2的116倍。

GPT-3有多达31位作者。来自Johns Hopkins大学OpenAI和Dario Amodei的研究人员证明,在GPT-3中,模型不需要对所有任务进行任何梯度更新或微调,只需与模型的文本进行交互以指定任务和少数示例,即可获得良好的结果。

GPT-3在许多NLP数据集上表现优异,包括翻译、问答和文本填充空任务,其中也包括一些需要即时推理或领域适配的任务,如用同义词替换句子中的单词或执行3位数数学运算。

当然,GPT-3也可以生成新闻报道的样本,我们很难区分机器写的文章和人类写的文章。

新闻生成

据《华盛顿邮报》报道,经过两天的激烈辩论,联合卫理公会同意进行历史性的分裂:要么创建一个新教派,要么在神学和社会意义上保持保守。参加5月份年度教会会议的大多数代表投票赞成加强对任命LGBTQ神职人员的禁令,并制定新的规则来“惩罚”主持同性婚礼的神职人员。但反对这些措施的人有了新计划:2020年,他们将组建一个新教派——基督教卫理公会。

华盛顿邮报指出,联合卫理公会这个号称拥有1250万成员的组织,在20世纪初是“美国最大的新教教派”,但近几十年来一直在萎缩。这将是教会历史上的第二次分裂。第一次发生在1968年,当时只有大约10%的成员成立了福音联合弟兄会。《华盛顿邮报》指出,目前的分裂“对联合卫理公会来说恰逢其时,其成员多年来一直在流失”,这“将该教派推到了LGBTQ角色分裂的边缘”。同性婚姻并不是分裂教会的唯一问题。2016年,该教派因任命跨性别神职人员而分裂。北太平洋地区会议投票禁止他们成为神职人员,南太平洋地区会议投票允许他们成为神职人员。

你确定这不是报社记者写的短篇?

GPT-3用实力告诉你答案:不会

鉴于标题为“联合卫理公会同意这一历史性分裂”,副标题为“反对同性婚姻的人将创建自己的教派”,GPT-3生成了上述新闻。

就问能不能看到?不管怎样,我放弃了...

在OpenAI的测试中,人类评测人员也很难判断这个消息的真假,检测准确率只有12%。

然而,GPT 3号有时会失手。比如下面这些GPT-3生成的短文,人类判断真伪的准确率已经达到了61%!

根据OpenAI的统计,人类对GPT-3 175B模型生成的500字左右文章的判断准确率为52%,但与GPT-3控制模型(一个没有上下文,输出随机性不断增加,只有1.6亿个参数的模型)相比,GPT-3 175B生成的文本质量要高得多。真的很暴力!

“牙牙学语”,造句能力GPT-3

给出一个新单词及其定义,造一个新句子。很难吗?这需要你理解单词的意思和适用的上下文。OpenAI的研究人员在这项任务中测试了GPT-3的能力:给出一个不存在的单词(如“Gigamuru”),让GPT-3用它来造句。

我们来看看GPT-3的生成结果:

给一个新词“Gigamuru”(日本的一种乐器)。

GPT-3给出的句子是:我叔叔给了我一个Gigamuru,我喜欢在家里玩。

完美契合,非常合理完美!

看另一个动词例子:

给新词“screeg”(剑,击剑)。

GPT-3造的句子是:我们玩了几分钟击剑,然后出去吃冰淇淋。

也不错。

接下来,让我们看看GPT-3的其他能力。

语法更正

给出一个有语法错误的句子,让GPT-3修改。

第一个例子中,原句中有两个并列的动词“was”和“died”。GPT-3删除了动词“was ”,并将其改为正确的句子。

第二个例子中,原句中likes后面的self是we的反身代词,这里like这个动作的执行者是Leslie,所以即使likes后面用了反身代词,也应该是他自己,还有一个改动是把反身代词改成we的宾语us,即“我们认为Leslie喜欢我们”。

宾果!GPT 3号答对了。

看了GPT-3的纠错效果,英语老师真的很欣慰,学生也很惭愧...

GPT 3号还能做计算吗?

不仅英语老师高兴,数学老师也跑不掉。GPT 3号可以进行简单的计算。

OpenAI的研究人员在没有任何特定任务训练的情况下,测试了GPT-3在以下10项任务中进行简单计算的能力。

这十个任务分别是:两位数加减、三位数加减、四位数加减、五位数加减、两位数乘法和一位数混合运算。

测试GPT三号计算能力的十项任务。

在这十个任务中,模型必须生成正确的答案。对于每个任务,该研究生成了一个包含2000个随机实例的数据集,并在这些实例上评估了所有模型。

下图显示了GPT-3(少射)在这十个计算任务上的性能。从图中可以看出,小型号的性能较差。即使是拥有130亿个参数的模型(仅次于拥有1750亿个参数的GPT-3模型),在处理两位数加减运算时的准确率也只有50%左右,处理其他运算的准确率不到10%。

GPT-3在多语言建模任务中的表现

发布时,GPT-2在许多特定领域语言建模任务中取得了最佳性能。现在,让我们看看GPT-3在参数和成本大幅增加后的效果。

OpenAI在很多任务中测试了GPT-3的性能,包括语言建模、补全、问答、翻译、常识推理、强力胶等等。具体结果如下表所示:

不同模型在所有任务上的表现,以及任务的SOTA表现(包括模型大小、训练细节和其他信息)。

GPT-3的技术分析

最近的大量研究工作表明,通过对大量文本进行预训练,并针对特定任务进行微调,可以在许多NLP任务和基准测试中显著提高模型的性能。

最近,OpenAI团队训练了GPT-3(一个具有1750亿个参数的自回归语言模型,是之前任何非稀疏语言模型的10倍),并在少数镜头环境下测试了它的性能。在所有任务中,GPT-3可以直接应用于特定任务和小样本演示,无需任何额外的梯度更新或微调,仅通过模型和文本之间的交互。

GPT-3在许多NLP数据集上表现优异,包括翻译、问答和内容填充任务,以及许多需要实时推理或领域自适应的任务,如用新词造句或进行三位数运算。GPT-3生成的新闻文章足以以假乱真,人类评价者难以分辨。

然而,GPT 3号也有缺点。研究小组发现,GPT-3(少数镜头)在文本合成和多个NLP数据集上的性能不够好,仍然存在一些结构和算法缺陷。另一种语言模型大多存在“预训练样本效率低”的问题。GPT-3在预训练期间阅读的文本比人们一生中阅读的还要多。此外,还有可解释的问题。

预培训方法

open ai团队使用的基本预训练方法包括三个部分:模型、数据和训练。GPT-3的训练过程与GPT-2相似,但模型规模、数据集规模和多样性、训练长度相对直接扩展。关于语境学习,GPT-3也使用类似于GPT-2的方法,但GPT-3研究小组系统地探索了不同的语境学习设置。

OpenAI团队明确定义了评估GPT-3的不同设置,包括零拍、单拍和fev-shot。

微调(FT):微调是近年来最常用的方法,涉及到在预期任务的特定数据集上更新预训练模型的权重;

少射(FS):在本研究中是指在推理阶段为模型提供少量任务演示,但不允许更新网络权重的情况;

One-Shot (1S):单个样本类似于小样本,但除任务的自然语言描述外,只允许进行一次任务演示;

Zero-Shot (0S): Zero sample与single sample类似,只是不允许演示,只为模型提供描述任务的自然语言指令。

零拍、单拍、少拍设置与传统微调方式对比。

以英法翻译任务为例,上图显示了四种方法。本研究侧重于零拍、一拍和少拍,其目的不是将它们作为竞品进行比较,而是将其设置为不同的问题。OpenAI团队特别强调了少量拍摄的结果,因为其中许多结果仅略次于SOTA微调模型。但是用人类的水平来比较一拍甚至有时候零拍似乎是最公平的,这也是未来工作的重要目标之一。

模型和架构

这项研究使用了与GPT-2相同的模型和架构,包括改进的初始设置、预规范化和可逆令牌化。不同的是,GPT-3在变压器的所有级别使用交替的密集和局部稀疏注意模式,类似于稀疏变压器[CGRS19]。

为了研究性能对模型规模的依赖性,本研究训练了8个不同的模型规模,覆盖了3个数量级,从1.25亿个参数到1750亿个参数。拥有1750亿个参数的模型是GPT-3。

之前的研究[KMH 20]表明,在训练数据充足的情况下,验证损失的缩放比例应该近似为模型规模的光滑幂律函数。这项研究训练了几个不同规模的模型,使研究人员能够测试验证损失和下游语言任务的假设。

表2.1显示了八种型号的尺寸和架构。这里n_params表示可训练参数的总数,n_layers表示层数,d_model表示每个瓶颈层的单元数(在本研究中,前馈层始终是瓶颈层大小的4倍,即d _ ff = 4d _ model),d_head表示每个注意头的维数。所有模型都使用n_ctx = 2048个令牌的上下文窗口。

表2.1:本研究中训练的八个模型的尺寸、结构和超参数信息。所有型号总共使用了3000亿代币。

为了最小化节点间的数据传输,本研究将跨GPU模型从深度和宽度两个方向进行划分。然后,基于跨GPU模型布局的计算效率和负载均衡,选择每个模型的精确架构参数。之前的研究[KMH 20]表明,在合理的范围内,验证损失对这些参数不是特别敏感。

训练数据集

下表描述了GPT-3培训过程中使用的数据集。

表2.2:培训GPT-3的数据集。

OpenAI:其实我们玩不起。

一开始,我们训练不起来。后来finetune买不起了。现在在GPT-3模式的时代,我们甚至前进不起。

你一定想问这样一个问题:训练GPT-3模型要花多少钱?目前,我们只能粗略估计训练一个BERT模型大约需要6912美元,训练GPT-2每小时需要256美元,但OpenAI从未透露需要多少小时。

相比之下,GPT-3需要的计算能力(flops)是BERT的1900多倍,所以这个数字应该在几千万美元的量级,所以研究人员在论文的第九页说:我们发现了一个bug,但是我们没有钱重新训练模型,所以我们还是算了吧。

但即便如此,它的效果依然惊人。

GPT 3号的实验结果似乎验证了理查德·萨顿(Richard Sutton)去年有争议的结论。在《惨痛的教训》的最后,他写道:“我们应该从惨痛的教训中学到一件事:通用方法是非常强大的,这些方法会随着计算能力的增加而不断扩展。搜索和学习似乎就是这样的方法。」

关于GPT 3号的更多细节,请看《https://arxiv.org/abs/2005.14165.》这份报纸

,

猜你喜欢:综合百科

综合百科人工预测和ai预测(史上最大AI模型GPT-3上线:不仅会写文)

转载请注明:原文链接 | http://www.nnxc.com.cn/10043316845.html