权巅:从党政一肩挑开始 第782节
各国政府、大型企业、云计算巨头争先恐后地采购GPU集群,唯恐落后一步就被时代抛弃。
但如果有一份可验证的技术方案证明,十分之一的算力就能达到同等效果呢?
那就意味着,全球算力需求的增长预期会被大幅下修。GPU制造商的估值逻辑会被动摇。
更重要的是,整个算力霸权的叙事会出现裂缝,而裂缝一旦出现,就无法被修复。
因为开源意味着全世界任何一个开发者都可以验证这个结论。
事实会杀死叙事。
梁文风闭上眼睛,将陈捷的话和自己的判断在脑海中做了最后一次校准,然后睁开眼,拿起了手机打通了一个号码:
“周博,假期辛苦你了,技术报告终稿不需要再改了,按开源发布的路径执行。”
“全量放出去?”电话那头周博有些振奋。
“全量,架构论文、训练代码、推理框架、模型权重,一个不留。”
“开源协议用MIT还是Apache 2.0?”
“用最宽松的那个,不设任何商业使用限制。”
“明白了,我这边准备一下代码仓库和文档,预计三天可以上线。”
“两天。”梁文风道,“三号之前必须上线。”
周博没有问为什么,直接应了一声:
“好。”
梁文风挂断后,又打给了老曹:
“老曹,模型发布时间确定了,十月三号。”
“这么快?”老曹有些惊了。
“你那边准备好了没有?”
“远月期权的仓位已经建好了,但如果发布时间是三号,那节后亚洲市场开盘前可能还需要微调一下对冲比例。”
“具体我不管,你自己把控风险。”
“好。”
梁文风挂掉电话,靠回椅背上。
窗外是杭城西湖方向的灰蒙蒙天际线。
十月初的江南还残留着一些暑气,但空气里已经开始有了秋天的清冷。
他想起一月份在武河光谷科学岛,陈捷和他那次谈话中说的一句话:
“太早,市场泡沫未形成,冲击有限,太晚,别人可能先做,在市场预期膨胀最高、主流叙事最脆弱时精准披露,才有最大范式颠覆效应。”
现在是十月。
全球市场刚刚经历了三季度财报季,美国几大科技巨头纷纷宣布了数百亿美元的AI基础设施投资计划。
市场对算力需求的预期处于历史最高位。
主流分析师的报告里充斥着AI算力需求将在未来三年增长十倍,GPU供应将持续紧张到2025年底之类的判断。
叙事膨胀到了最极致、也最脆弱的时刻。
……
十月三日,凌晨三点四十七分。
全球最大的开源代码托管平台上,一个新的代码仓库被创建。
仓库名称朴素得几乎不引人注意。
README文件的第一段话是:
“我们发布了一个基于MoE稀疏混合专家架构的六百四十亿参数语言模型,在主流基准测试上,该模型的性能全面逼近或部分超越了当前最先进的千亿级稠密模型,而训练所需算力仅为同级别稠密模型的约十分之一,完整的架构设计、训练策略和模型权重已按MIT协议开源。”
凌晨时分,几乎没有人注意到这个仓库的出现。
但技术社区里永远不缺失眠的人。
第一个注意到这个仓库的,是美国西海岸一位刚下班的机器学习工程师。
他在浏览新发布的开源项目时,看到了那段README,起初以为是又一个夸大其词的个人项目。
但当他点进去看到完整的技术报告,详尽的实验数据和一百四十七页的论文时,顿时来了兴趣,并快速浏览了论文的核心章节和基准测试结果表格。
随后他在社交媒体上发了一条帖子:
“这个项目如果是真的,那一切都变了。”
六个小时后,这条帖子被转发了四千多次。
全球人工智能研究社区开始了一场狂热的验证运动。
欧洲、北美、东亚、东南亚的独立开发者和学术团队纷纷下载模型权重,在各自的硬件环境中运行基准测试。
到十月三日晚间,第一批独立复现结果陆续出现在各大技术论坛上。
结论几乎一致。
模型性能与论文报告的数据完全吻合。
在多项公开基准测试上,这个六百四十亿参数的稀疏模型确实达到了甚至部分超越了市面上最好的千亿级稠密模型的水平。
而它的训练成本,按照论文中公布的GPU小时数和硬件配置推算,大约只有同类项目的十分之一。
用更少的钱,做到了同样甚至更好的事。
这个结论像一颗深水炸弹,在全球AI社区炸开了。
十月四日,全球主要科技媒体开始密集报道。
标题一个比一个醒目。
“华国团队用十分之一算力打破AI效率天花板。”
“开源颠覆者:六百四十亿参数模型重定义人工智能成本方程。”
“算力军备竞赛还有意义吗?一份来自华国的答案。”
报道的主要内容,就是过去两年,全球花了几千亿美元去追逐算力扩张,但现在有人证明,真正的突破不在硬件堆叠,而在算法效率。
而这个证明来自一个在美国芯片出口管制压力下,被迫用有限算力资源探索替代路径的华国团队。
……
十月五日,国庆假期第五天。
这个消息在华国国内互联网上的传播速度远超预期。
不仅技术圈在讨论,财经圈、政策圈、甚至普通网民都开始关注。
核心原因在于叙事的反转效应。
过去两年,华国公众对美国芯片管制的普遍情绪是焦虑和悲观,许多人担忧华国在人工智能领域会因为算力限制而被彻底甩开。
现在,一个华国团队用公开可验证的方式证明了另一条路径的可行性,焦虑瞬间转化为自信。
网络上的讨论热度呈几何级数增长。
各大平台上关于这个模型的话题阅读量在两天内突破了十亿次。
陈捷在这几天里,没有在任何公开或私下场合提到过这件事。
国庆假期他按照正常节奏度过。
除了每天关注各项假期安全生产和社会民生实时监控数据外,就是陪陈诺去东湖绿道骑自行车,在家里看书,或者和苏晴一起做饭。
陈捷知道互联网上发生了什么。
但他不看热搜,不评论,也不主动向任何人提起幻方量化或武河实验室。
这件事在公众认知中,是一家杭城量化基金旗下的人工智能研究实验室做出的突破。
它在武河有研发基地这件事,只有很少的人知道。
这正是陈捷要的效果。
影响力如水,水善利万物而不争,处众人之所恶,故几于道。
……
十月七日,国庆假期最后一天。
燕京,国务院副总理丁仲航正在书房里翻看一沓打印材料。
丁仲航分管科技、教育和产业政策。
六十岁,清华工科出身,在科技部系统干了近二十年,一路做到副部长,再到科技部部长,两会后进入国务院领导序列。
他面前这沓材料是科技部综合司在假期加班整理的一份专题简报:
《近期全球人工智能技术突破性进展及对我国产业政策的影响分析》
简报核心内容围绕幻方量化武河实验室发布的开源模型展开,但视角是政策层面的。
丁仲航看得很仔细,还在几处关键段落做了标注:
上一篇:开局停职?我转投纪委调查组
下一篇:返回列表
