李飞飞叫板梁文锋?几百元不到半小时蒸馏出AI模型

最近梁文锋的DeepSeek很火,震惊了华尔街。那么,问题来了,既然DeepSeek是蒸馏出来的大模型,其他人会不会效仿这种方法。第一个叫板DeepSeek的是华裔李飞飞,据透露,她仅用50美元,短时间就蒸馏出类似DeepSeek-R1的推理模型S1,该模型在数学及编码能力方面,与OpenAI O1和DeepSeek R1几乎处于同一水平。

参与研制S1模型的,是李飞飞团队(包括斯坦福大学及华盛顿大学的研究人员)等,花费50美元,折合人民币大约360元。当然,这只是部分成本(云计算费用)。该团队使用了16个英伟达H100 GPU,用时26分钟完成了训练过程‌。

当然,李飞飞团队的S1模型,同样是站在前人肩膀上的,秘诀同样是蒸馏。其以阿里通义团队的Qwen2.5- 32B-Instruct作为基础模型,并通过蒸馏谷歌DeepMind的推理模型Gemini 2.0 Flash Thinking实验版,最终蒸馏出S1模型。目前,该模型已宣布开源,李飞飞研究团队公布了训练数据及代码。

李飞飞何许人也?她1976年出生于北京,有“AI教母”之称。据公开信息,她16岁随家人移民美国新泽西。她是人工智能方面的专家,美国斯坦福大学首位红杉讲席教授,长期研究人工智能。2013年至2018年,她担任斯坦福人工智能实验室主任,她还曾担任过Google副总裁以及Google Cloud AI/ML首席科学家。

李飞飞集多重荣耀于一身,是美国国家工程院院士、美国国家医学院院士、美国艺术与科学院院士。李飞飞的研究领域主要包括计算机视觉、认知神经科学、计算神经科学和大数据分析。

美国工程院对李飞飞的评价是:她为建立大型机器学习和视觉理解知识库做出了贡献。斯坦福大学对李飞飞给出了高度评价,认为她是ImageNet和ImageNet Challenge的发明者,为深度学习和AI的最新发展做出了贡献。并且,斯坦福大学还称赞她,除了技术贡献外,还是倡导STEM及AI多样性的全国领导者。

免责声明:此文内容为第三方自媒体作者发布的观察或评论性文章,所有文字和图片版权归作者所有,且仅代表作者个人观点,与极客网无关。文章仅供读者参考,并请自行核实相关内容。投诉邮箱:editor@fromgeek.com。

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,应及时向本网站提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明。本网站在收到上述法律文件后,将会依法尽快联系相关文章源头核实,沟通删除相关内容或断开相关链接。

2025-02-10
李飞飞叫板梁文锋?几百元不到半小时蒸馏出AI模型
李飞飞叫板梁文锋?几百元不到半小时蒸馏出AI模型

长按扫码 阅读全文