DeepSeek 震动华尔街:一场改写 AI 格局的"春节风暴"
2025 年春节前夕,中国 AI 公司深度求索(DeepSeek)投下了一颗重磅炸弹。
他们发布的 DeepSeek-R1 模型,在多项基准测试上达到了接近甚至超越 OpenAI o1 的水平。如果仅仅是这样,它可能只会在 AI 圈内引发一阵讨论。但真正让全球震动的,是这个模型背后的几个数字——训练成本仅约 600 万美元,使用的还是被美国制裁后"阉割"过的芯片。
这直接动摇了硅谷过去两年最核心的投资叙事,并在 2025 年 1 月 27 日引发了一场史无前例的美股大跌。
这篇文章会带你回顾这场"春节风暴"的始末——它是怎么发生的?为什么影响这么大?以及它对 AI 行业的未来意味着什么?
1. 事件回顾:发生了什么?
1.1 DeepSeek-R1 横空出世
2025 年 1 月 20 日,DeepSeek 发布了 DeepSeek-R1 —— 一款推理能力极强的大语言模型。
几个关键事实:
- 性能:在数学推理、代码生成、复杂逻辑等多个基准测试上,R1 的表现与 OpenAI 的 o1 模型不相上下,部分指标甚至超越
- 训练成本:约 600 万美元——而 OpenAI 训练 GPT-4 的成本估计在 1 亿美元以上,差了近 20 倍
- 硬件条件:由于美国对华芯片出口管制,DeepSeek 无法获得最顶级的 NVIDIA H100/A100,只能使用被限制过的 H800 芯片,且仅用了 2048 张
- 开源策略:采用 MIT 协议完全开源,任何人都可以下载、使用、商用
一句话总结:用更少的钱、更弱的硬件、更开放的方式,做出了同等水平的模型。
连 OpenAI CEO Sam Altman 也不得不公开承认。他在 1 月 28 日发推说:
"deepseek's r1 is an impressive model, particularly around what they're able to deliver for the price. we will obviously deliver much better models and also it's legit invigorating to have a new competitor! we will pull up some releases."
(DeepSeek 的 R1 是一个令人印象深刻的模型,尤其是他们能以这样的价格交付的东西。我们显然会交付更好的模型,同时有一个新的竞争者确实令人振奋!我们会加快一些发布。)
1.2 华尔街的"黑色星期一"
2025 年 1 月 27 日,农历大年廿八。当中国人忙着准备年货的时候,大洋彼岸的华尔街炸了。
美股开盘后,AI 相关股票遭遇了史上最大的单日暴跌:
| 股票 | 跌幅 | 市值蒸发 |
|---|---|---|
| NVIDIA(英伟达) | ~17% | ~5900 亿美元 |
| 博通(Broadcom) | ~17% | ~1400 亿美元 |
| AMD | ~6% | ~150 亿美元 |
| 台积电(ADR) | ~8% | ~800 亿美元 |
| 微软 | ~2% | ~700 亿美元 |
NVIDIA 单日蒸发 5890 亿美元,创下了美股历史上单只股票最大单日市值损失纪录——几乎是此前纪录(2024 年 9 月 NVIDIA 自己创下的 2790 亿美元)的两倍。
Nvidia sheds almost $600 billion in market cap, biggest one-day loss in U.S. history.
整个纳斯达克指数下跌 3.1%,全球科技股跟跌,恐慌情绪蔓延。
1.3 时间线
让我们回顾一下关键时间节点:
- 2024 年 12 月:DeepSeek 发布 V3 模型,已经引起技术圈关注
- 2025 年 1 月 20 日:DeepSeek-R1 正式发布,论文公开,代码开源
- 1 月 20-26 日:AI 技术社区热议,但主流金融市场尚未充分反应
- 1 月 27 日(周一):华尔街开盘暴跌,NVIDIA 创纪录下跌
- 1 月 28-29 日:全球媒体铺天盖地报道,DeepSeek App 登顶美国 App Store 及全球 51 个国家的下载榜,周末下载量从 100 万暴增至 260 万
- 1 月 30 日(除夕):中国春节假期开始,但全球 AI 行业的讨论远未停歇
2. DeepSeek 是怎么做到的?
这是所有人最关心的问题:用这么少的资源,怎么可能训练出这么强的模型?
2.1 MoE 架构:不是所有参数都需要同时工作
DeepSeek-R1 采用了 MoE(Mixture of Experts,混合专家模型) 架构。
传统的大模型(如 GPT-4)是"稠密模型"——每次处理输入时,所有参数都参与计算。这就像一家公司,不管来了什么业务,全公司所有人都得动起来。
MoE 的思路不同:模型内部有很多个"专家"模块,每次处理输入时,只有少数几个最相关的专家被激活。就像一家律师事务所,来了知识产权的案子就派知识产权律师,来了刑事案件就派刑事律师,不需要全所动员。
DeepSeek-R1 的具体数据:
- 总参数量:6710 亿(671B)
- 每次推理激活的参数:仅 370 亿(37B)
这意味着模型拥有大模型的知识广度,但计算成本只需要小模型的代价。
2.2 工程优化:把每一张 GPU 榨干
除了架构创新,DeepSeek 在工程层面也做了大量优化:
- FP8 混合精度训练:使用更低精度的数字格式进行计算,在几乎不损失质量的情况下,大幅减少显存占用和计算量
- Multi-head Latent Attention(MLA):对注意力机制做了压缩优化,降低了推理阶段的显存需求
- 高效的并行策略:在有限的 2048 张 GPU 上,设计了精细的数据并行和流水线并行方案,最大化硬件利用率
简单说就是:硬件受限倒逼了极致的工程优化。 当别人有 16000 张顶级 GPU 可以"浪费"的时候,DeepSeek 被迫把每一张卡的潜力都榨干了。
2.3 蒸馏技术:站在巨人的肩膀上
DeepSeek 还大量使用了知识蒸馏(Knowledge Distillation) 技术——用大模型("教师模型")生成高质量的训练数据,来训练小模型("学生模型")。
这就像名师带徒弟:老师不需要把自己几十年的经历完全复制给学生,只需要把精华的解题思路和方法教给学生,学生就能达到很高的水平。
这种方法让 DeepSeek 能够在较小的计算预算下,获得接近大模型水平的训练效果。
3. 华尔街为什么反应这么剧烈?
一个中国 AI 公司发了个开源模型,为什么会导致美国最大的芯片公司蒸发 5900 亿美元?
要理解这个问题,需要先理解过去两年华尔街的 AI 投资叙事。
3.1 "算力军备竞赛"叙事
从 2023 年 ChatGPT 爆火开始,华尔街形成了一套核心投资逻辑:
AI 是一场军备竞赛 → 谁有更多更强的 GPU,谁就能训练出更强的模型 → NVIDIA 是唯一的"卖铲人" → NVIDIA 的需求会持续爆炸式增长
这套逻辑推动 NVIDIA 的股价从 2023 年初到 2025 年初涨了 超过 8 倍,市值一度突破 3 万亿美元,成为全球市值最高的公司之一。
微软、Google、Meta、Amazon 等科技巨头也纷纷宣布数百亿美元的 AI 基础设施投资计划,其中大部分都花在了购买 NVIDIA 的 GPU 上。
3.2 DeepSeek 动摇了什么?
DeepSeek 的出现,直接挑战了这套叙事的核心假设——训练顶级 AI 模型,真的需要那么多顶级 GPU 吗?
如果 600 万美元 + 2048 张 H800 就能做出 o1 级别的模型,那:
- NVIDIA 的 GPU 需求真的会持续暴增吗? 也许各大公司不需要买那么多卡了
- 科技巨头数百亿的资本开支(CapEx)合理吗? 如果训练成本大幅下降,这些投资可能回报率堪忧
- 算力护城河还存在吗? 如果弱一点的硬件也能训练出强模型,那芯片管制的效果也要打折扣
用一个比方来说:过去大家以为淘金热中最赚钱的是卖铲子的(NVIDIA),现在突然有人证明用勺子也能挖到金子。
3.3 恐慌的放大效应
市场的反应被几个因素放大了:
- 时间点特殊:消息在周末发酵,周一集中释放
- 估值过高:NVIDIA 当时的估值已经处于历史极高水平,容错空间几乎为零
- 量化交易:算法交易的连锁反应加剧了跌幅
- 叙事转变:从"AI 需要无限算力"到"AI 可能不需要那么多算力",这种根本性的叙事转变让很多持仓逻辑直接失效
4. 这件事的深远影响
DeepSeek 事件的影响远超一次股价波动。它改变了整个 AI 行业的很多基本假设。
4.1 开源 vs 闭源:格局被改写
在 DeepSeek-R1 之前,最强的 AI 模型几乎都是闭源的(GPT-4、Claude、Gemini)。开源模型(如 Llama)虽然可用,但与闭源模型有明显差距。
DeepSeek-R1 第一次证明了:开源模型可以达到闭源模型的水平。 这对 OpenAI 的商业模式构成了直接挑战——如果竞争对手免费提供同等能力的模型,凭什么让客户付费?
4.2 中美 AI 竞争:制裁的"意外后果"
美国的芯片出口管制本意是限制中国的 AI 发展,但 DeepSeek 的故事说明了一个反直觉的道理:约束有时候反而催生创新。
正是因为拿不到最好的芯片,DeepSeek 才被迫在架构和工程上做到极致优化。这些优化思路(MoE、MLA、高效并行)反过来成为了整个行业可以学习的经验。
有人打了一个比喻:就像二战时期,物资匮乏的国家反而发明了很多高效的技术方案。
4.3 Scaling Law 遭到质疑
过去几年,AI 行业有一个广泛接受的信条——Scaling Law(规模定律):模型越大、数据越多、算力越强,效果就越好。
DeepSeek 让人们开始重新思考:也许"怎么训练"比"用多少资源训练"更重要? 架构创新、训练技巧、数据质量,这些"软"因素可能比单纯堆算力更有价值。
这并不是说 Scaling Law 失效了,而是说只靠堆资源的粗放式 scaling 可能不是唯一的路径。
4.4 AI 成本下降:利好普及
从另一个角度看,DeepSeek 的出现对 AI 的普及是一个巨大的利好。
如果训练和部署 AI 模型的成本大幅下降,那意味着:
- 更多中小企业和创业者能负担得起 AI 技术
- AI 应用的落地速度会加快
- 整个行业的竞争会更加多元化,不再只是少数巨头的游戏
经济学上有一个经典理论叫 Jevons Paradox(杰文斯悖论):当某种资源的使用效率提高时,它的总消耗量反而会增加,因为降低的成本刺激了更大的需求。
套用到 AI 上:GPU 单位成本下降 → AI 使用场景爆发 → GPU 总需求可能反而上升。 这也是为什么 NVIDIA 的股价在暴跌后又迅速反弹的原因之一。
5. 后续发展
5.1 市场反弹
暴跌并非故事的结局。在最初的恐慌过后,市场逐渐消化了 DeepSeek 的冲击:
- NVIDIA 股价在接下来的几周内逐步回升,但波动加剧
- 投资者开始用更理性的框架重新评估:AI 效率提升 ≠ AI 需求下降
- 各大科技公司陆续表态,不会削减 AI 资本支出计划
5.2 行业反应
- OpenAI:加快了新模型的发布节奏,并开始重新考虑部分模型的开源策略
- Meta:继续押注开源路线(Llama 系列),认为 DeepSeek 验证了开源模式的竞争力
- Google:加速了 Gemini 系列的迭代,在效率优化方面投入更多
- NVIDIA:CEO 黄仁勋在多个场合回应,直言市场反应过度
"I think the market responded to R1, as in, 'Oh my gosh. AI is finished.' It's exactly the opposite. This reasoning AI consumes 100 times more compute than a non-reasoning AI."
(我认为市场对 R1 的反应是"天啊,AI 完了"。但事实恰恰相反。这种推理型 AI 消耗的算力是非推理型 AI 的 100 倍。)
5.3 DeepSeek 自身
DeepSeek 在风暴过后继续保持低调务实的风格:
- App 下载量暴增,登顶美国 App Store 及全球 51 个国家的免费应用榜,击败 ChatGPT
- 持续迭代和开源新模型
- 成为中国 AI 产业的一面旗帜
6. 怎么看待这件事?
回到最根本的问题:DeepSeek 事件告诉我们什么?
第一,技术创新可以打破资源垄断。 这是最核心的启示。在所有人都以为"有钱才能做 AI"的时候,DeepSeek 证明了聪明的架构设计和精细的工程优化可以弥补硬件差距。
第二,市场叙事有时候会过度简化现实。 "AI 需要无限算力 → NVIDIA 必涨"这种单一叙事忽略了技术演进的复杂性。现实中,效率提升和需求增长往往同时发生。
第三,竞争格局永远在变。 在 AI 这个领域,今天的领先者不一定是明天的赢家。开源社区、中国公司、创业团队,任何一方都可能带来颠覆性的创新。
第四,约束催生创新。 这或许是最浪漫的启示——正是因为条件有限,人的创造力才会被逼到极致。
总结
DeepSeek 在 2025 年春节前引发的这场风暴,表面上是一次股市暴跌,本质上是 AI 行业一次深刻的自我反思:
- 关于成本:训练顶级模型不一定需要天价预算
- 关于硬件:顶级芯片不是唯一的出路
- 关于开源:免费的模型可以和付费的一样强
- 关于竞争:没有人能永远垄断 AI 的未来
这场风暴改变了很多投资者的认知,也改变了很多从业者的思路。而它最大的遗产或许是:让整个行业重新相信,在 AI 这条路上,创造力和工程能力有时候比银行账户更重要。