公众号

梁文锋 3 小时投资者交流
把话说透了:克制、开源与通往 AGI 的路

DeepSeek · 愿景驱动 · AGI 路线图 · 算力差距 · 国产芯片

一场长约 3 小时 44 分钟的投资者交流会,梁文锋几乎把 DeepSeek 的底层逻辑全说了:为什么坚持开源、为什么只赚"十个月回本"的合理利润、AGI 的技术路线图长什么样、和美国到底差在哪、国产芯片还有没有戏。这篇把最值得记下来的几个点拎出来讲清楚。
• • •

1 一群平凡人,靠愿景组织起来

梁文锋说,做这家公司的初衷从来不是"赚多少钱、要上市"。最开始的几十个人如果是奔着钱来的,根本不会来。他们是怀着对世界的一份善意在做一件"金钱以外的事情"。

他二十年前最崇拜的管理者是 GE 前 CEO 杰克·韦尔奇。韦尔奇说的很多东西现在看可能都不对了,但有一点说对了:一个公司最重要的是它的愿景。愿景不是挂在墙上的标语,而是你实际怎么做。

✦ 没有组织的组织

"我们其实没有组织,就是愿景驱动的。"这个愿景甚至不是成文的,从没写出来过,它藏在做事的方法和对世界的态度里。他喜欢的叙事是——一群平凡的人做出了不平凡的事,而不是一群天才做出了不平凡的事。
• • •

2 为什么死磕开源?克制是一种战略

历史上开源和商业化往往是冲突的——一个软件公司市场就几十亿美金,开源了可能就剩几千万。但梁文锋认为 AI 不一样,因为这件事太大了,最终可能占掉人类 GDP 的百分之十。

这么大的蛋糕,一个人不可能独占。你越想着"人类 GDP 有多少归我",你越做不成。所以要克制。

✦ 克制 = 战略

"对我来讲,克制是一种战略。有时候你可以舍弃一些,来换更多其他的东西。"越克制,越有可能做成,也越能增加做成 AGI 的概率。开源只是克制的一部分。

他也不担心别人部署 DeepSeek 的模型来竞争,反而希望大家能部署起来。因为开源不等于别人就能轻易做到同样低的部署成本——这里面还有大量工作要做,而这恰恰是 DeepSeek 这个规模公司的"甜区"(sweet point)。

• • •

3 定价哲学:十个月回本,只赚合理利润

DeepSeek 的 API 定价逻辑很简单:买一批设备回来,大概十个月收回成本——大致对应六倍利润。这不是利润最大化的定价,因为在这个价格区间用户需求没有弹性,价格再翻倍,token 消耗量区别也不大。

他讲了个故事:一开始担心需求太多,把价格定得偏高,团队不太高兴;后来把价格降到四分之一,公司群里很多人是"欢呼"的。因为让 AI 便宜好用、大家都用得起,本身就是他们的动力和共识。

一个关键的博弈逻辑:假设 AI 能占 GDP 的 20%,如果你想拿其中的 5%,一定会被只想拿 1% 的人打败;出来一个只要 0.1% 的,又会把前面的人打败。拿得多的人,会被拿得少的人打败。甚至你还没真拿到,光是"愿景想拿得多",你就先输了。

六倍利润看着高,但在 AI 效率这么高的当下其实不高。未来可能降到四倍、三倍,但仍然会有很大利润空间。开源和商业付费之间,在六倍利润的前提下没有冲突。

• • •

4 AGI 路线图:一步一个台阶

梁文锋把 AI 的发展理解成一个"阶梯",每一步都建立在前一步的基础上,没有一步是白走的:

语言模型:最底层的地基

CoT 思维链:去年的台阶,让智能上一个台阶,在奥数、编程上已超过顶尖人类

Agent:今年的台阶,能力范围更大,智能上限更高

持续学习:下一个瓶颈,也是当前全世界都还没解决的问题

为什么持续学习是关键?现在的 AI,只要你给它完整的上下文和指令,它已经超过人类了。但它替代不了你的员工——因为员工能花两个月熟悉环境、持续学习,而 AI 不能。你没法把所有上下文都喂给它。

✦ 通往奇点的顺序

先解决"持续学习" → 再到能自我迭代的"智能奇点"(模型能自己开发下一版模型) → 最后才是"具身智能",走进现实世界帮你做家务、养老。

他强调这个奇点不是突变,而是一个渐进过程。而且这个顺序"最轻松"——因为可以用前面的技术帮助开发后面的技术,奇点之后的具身智能"就不用人来做了"。
• • •

5 C 端、B 端只是副产品——降维打击

去年春节 DeepSeek 突然爆火,"完全不在剧本里"。但他们并没有去抢用户、变现,甚至一度不想维护那些用户,"但用户赶都赶不走"。

他的判断是:前面的可能都是芝麻,后面的 AGI 才是西瓜。C 端、B 端都是做 AGI 路上顺手产出的副产品,"我只要搞几个人维护 API 就行,甚至没有客服,也不用销售"。

"站在一个技术的高位上,来做相对低一级别的技术,是有降维打击的。" AGI 是更大的愿景,能凝聚更优秀的人、有更强的凝聚力——组织上的优势,最终转化成产品上的优势。有意思的是:最想得到的东西反而得不到,不那么在意的反而容易得到。
• • •

6 唯一不能退让的核心利益:团队稳定

很多方面都要克制,那 DeepSeek 的核心利益是什么?梁文锋的回答干脆:只有一个,甚至是唯一的——保持团队的稳定性

"只要大家都不走,我们能够继续做,我就一定能做成 AGI,就这么简单。"钱不是问题,资源不是问题,其他要素都容易获得。团队稳定是最大的风险,也是唯一的挑战——而这次融资让大家拿到了较多期权,这个风险得到了较大解除。

• • •

7 和美国的差距,只有一个字:卡

梁文锋直言,和美国的差距几乎全在资源(算力)上,人上面差距不大。因为就是同一批人——聪明人出国还是留下其实是随机的,国内人才不缺,基数还大。

维度 DeepSeek 现状
当前算力 约 2 万张 H 等效,大部分刚到
国内模型规模 几十 B 激活,美国最大约 800B 激活
训 800B 需要 约 5 万张 GB300 / 20 万张华为卡(还不含研究)
整体叙事 落后美国约 1–2 年,但只用 1/20 的算力做出来

对于买卡,他的策略是"在合理价格内,能买多少买多少"——因为把钱变成英伟达卡比放银行划算太多,甚至愿意付一定溢价。"如果半年之内就把钱花完,那太理想了。"最终的模型差距会收敛到三点:成本、时间、用户体验,其中成本排第一。

• • •

8 国产芯片的历史性机遇:CUDA 护城河在瓦解

梁文锋对国产算力"比较乐观",甚至说"英伟达是在掘自己的坟墓"。CUDA 的护城河正在快速瓦解,原因有三:

AI 能写代码:用 AI 就能把英伟达那套生态重写一遍

新技术:DeepSeek 自己的高级语言 TileLang,能快速重写 CUDA 算子

专用芯片趋势:CUDA 源自游戏卡,如今计算卡市场已大于游戏卡,没理由再耦合

V3 训练时用的是英伟达的卡,但已经几乎不依赖英伟达的生态——先写一个高级编译器 TileLang,再基于它完成其他所有事。只要把这套东西在华为卡上重做一遍就完成了。用 TileLang 替代 CUDA,效率不降反升,硬件底层执行只损失 1%–2%,完全可接受。

他判断,一年之内就能验证"国产芯片生态完全没问题",硬件和生态都不是问题,唯一的问题是产能不够。华为 950 超节点在性能和价格上可以平替英伟达 GB200/GB300——代价是"四张华为卡顶一张英伟达,同时落后两年"。

• • •

9 没有组织的组织:一半时间自由探索,不加班

DeepSeek 的管理是两条线:从上到下(集体做一件事,比如发 V4,需要分工)和从下到上(每个人自己想做什么就做什么,没有 KPI)。梁文锋的一个标准是——"正式"的工作最好不要超过员工时间的一半,另一半留给他们自由探索。

他们一般不加班,原因有二:做研究需要松弛的环境,逼太紧就没法做研究;而且因为足够聚焦、够克制,要做的事情本来就少。公司的决策机制是"寻求共识"——他的权威建立在共识之上,引导作用非常有限。

✦ 两个反直觉的细节

"摸奖"文化:核心研究不消耗多少卡和人,需要的是想法。门槛很低谁都能摸,但谁能摸出东西"看天赋"。

一半核心研究员在标数据:现阶段解决 AI 问题靠的就是标数据。高质量数据标注成本很高,中国并无成本优势,这也是和美国拉开差距的地方之一,主要卡在时间上。

关于下一代模型,他提了一个"有点奇怪但很多人这么想"的目标:模型的第一目标不是让用户好用,而是让 DeepSeek 自己好用——能加速自己开发下一版模型。这被认为是实现 AGI 最快的路径。

• • •

10 几个零散但值得记的判断

视频生成/世界模型:商业上是好生意,但和智能主线关系不大,DeepSeek 不做

多模态:会做(V4 后续支持原生多模态),但它只是个"组件",不是智能本身

Scaling:坚信 Scaling,还远没碰到墙,阻止 Scaling 的只是算力

垂直应用:现阶段最重要的是通用的 Coding Agent,金融/医疗等垂直 Agent 优先级更低

中国在全球分工中的角色:很可能是"产量最大"的一极,把 AI 做到系统性地更便宜

AGI 何时到:AI 加速 AI 研究,是非线性过程、没有临界点;终点大概率是具身智能

说明:本文要点整理自一份长约 3 小时 44 分钟的投资者交流录音文字稿(语音识别自动转写、AI 整理,未区分说话人)。个别专有名词与数字可能存在识别误差,请以原始信息为准。文中观点均为梁文锋在交流会上的个人表述,不构成任何投资建议。

如果这篇整理对你有帮助,欢迎点赞、在看、转发三连 🙏

关注我,持续分享 AI 时代的技术实战与深度思考