Meta推出Llama 3大模型 在集成近25000块英伟达H100计算集群上训练

4月19日消息,据外媒报道,Meta公司在当地时间周四推出了他们最新一代大语言模型Llama 3的早期版本,并宣布推出基于这一模型打造的人工智能助手Meta AI

从外媒的报道来看,同前一代大模型Llama 2一样,Meta新一代的Llama 3大模型,也注重供用户免费使用,目前已有两种不同参数版本的Llama 3可供用户使用,分别为80亿参数和700亿参数,均已可在Meta官网下载。

对于Llama 3大语言模型,Meta公司CEO马克•扎克伯格在接受采访时透露,他们在训练700亿参数的模型时,使用了15T tokens的数据,在训练过程中模型从未达到饱和状态,也就是从未在能力提升过程中遇到瓶颈,Meta最终也解决了训练过程中遇到的问题,并转向训练其他的模型。

正如外媒在报道中所提到的一样,Meta目前推出的还只是Llama 3的早期版本,他们还在训练更强大的模型。外媒在报道中就提到,Meta已宣布他们目前正在训练有4000亿参数的Llama 3模型,部分专家认为他们的这一模型,在MMLU、GPQA、HumanEval、MATH等方面的表现,将与OpenAI的GPT-4 Turbo, Anthropic的Claude 3 Opus和谷歌的Gemini Ultra相当。

作为全球人工智能领域重要参与者的英伟达,在Meta训练的Llama 3上也发挥了关键作用,提供了大量的GPU。

在Meta宣布推出Llama 3之后不久,英伟达就在官网上披露,Meta的工程师是在集成了24,576块H100 GPU的计算集群上训练的Llama 3,这些GPU通过英伟达的Quantum-2 InfiniBand网络连接。在英伟达的支持下,Meta也为他们的旗舰模型调整了网络、软件和模型架构。(海蓝)

(免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。
任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,应及时向本网站提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明。本网站在收到上述法律文件后,将会依法尽快联系相关文章源头核实,沟通删除相关内容或断开相关链接。 )

赞助商
2024-04-19
Meta推出Llama 3大模型 在集成近25000块英伟达H100计算集群上训练
GPU通过英伟达的Quantum-2 InfiniBand网络连接。

长按扫码 阅读全文