LONG READ基于录音转写内部交流语境

梁文锋谈 DeepSeek

克制,
是一种战略

一场关于愿景、开源、合理利润、AGI 路线、
国产算力与组织方式的长谈

开始阅读

愿景不是挂在墙上的标语,
愿景是你怎么做,不是怎么说。

发言人梁文锋
交流对象投资人
原始时点转写未标注
材料性质录音文字整理

READ THIS FIRST

这不是一份官方公告

本页仅依据用户提供的录音转写整理。原文包含口语停顿、缺字、听写误差和时点性数字; 页面保留讲话的论证结构,但不对其中的公司数据、技术判断或未来计划作独立核验。 录音中主持人特别提醒部分数字具有敏感性,因此此页适合在受限范围内阅读。

一条贯穿全场的逻辑

从“善意”出发,
落到每个现实选择

01

愿景要写在行动里

不用成文口号或 KPI 维持一致,而是让开源、定价、产品取舍和日常协作共同表达愿景。

02

克制是一种战略

不追求拿走 AI 的最大份额;少拿一些,反而可能减少阻力、提高做成 AGI 的概率。

03

商业化是中间产出

C 端用户和 B 端 API 被视为通往 AGI 路上的副产品,而不是牵引研发方向的终点。

04

持续学习是下一道门

在语言模型、思维链和 Agent 之后,持续学习被判断为迈向自我迭代的关键瓶颈。

05

团队稳定是核心利益

钱、资源和时间都能补,真正不能退让的是关键人才长期留在同一目标上。

商业逻辑

不拿最多,
才更可能做成

讲话里最反复出现的词,不是“领先”,而是“克制”。 它既被描述为价值观,也被当作一套长期竞争策略。

其基本判断是:AI 的潜在市场大到任何一家企业都无法独占。越试图攫取过高份额, 越会遇到监管、产业、技术和竞争上的阻力;反过来,主动限定自己获取的利益, 可能让公司更容易聚集人才、争取合作,并长期留在牌桌上。

“你拿得太少了,你活不下去;你拿太多了,你会被拿得少的人打败。”

这套逻辑被直接用于 API 定价。转写原文提出, 以买回设备后大约十个月收回成本作为“合理利润”的参照; 同时也承认仍有降价空间,只是当价格已经足够可负担时, 进一步降价未必带来更多需求或社会价值。

一个具体故事是:某款模型最初为避免需求过载而定价较高, 后来价格降至四分之一,团队群里反而出现欢呼。 讲话者把这一幕视为内部共识的证据——模型被做出来,是为了让更多人充分使用, 不是为了在需求缺乏弹性的区间里榨取最高收入。

开源

不是迫不得已的让利

讲话将开源视为愿景的自然结果,同时认为它与商业化没有必然冲突。 权重公开之后,低成本部署、稳定服务和工程优化仍然是门槛; 当官方价格只包含合理利润时,第三方很难靠简单复刻获得空间。

C / B 端

是 AGI 路上的副产品

C 端用户与 B 端 API 会被维护、服务并商业化,但不反过来决定研究路线。 去做超级 App、广告、电商或纵向闭环,都被认为可能过早消耗组织注意力。

取舍

芝麻会捡,但不为它停下

讲话用“芝麻与西瓜”比喻短期流量和更远的 AGI 机会: 顺手得到的收入与用户可以保留,却不值得让公司停下来转向全面商业扩张。

技术路线图

下一道门,
叫“持续学习”

当前 AI 在“完整上下文 + 完整指令”的封闭任务中已经很强, 但它不像一个入职两个月的员工那样,能逐步理解公司、人际关系与隐含规则。 讲话将这种长期吸收上下文的能力,视为 Agent 之后最明确的障碍。

“如果 AI 具有持续学习的能力,它跟你的员工一样,到公司学习两个月, 那就可以替代天下的人了。”
01
已经走过

语言模型

在明确上下文与指令中完成任务,是后续能力的基座。

02
上一阶梯

思维链 CoT

让模型通过“自己思考”拓展推理上限,尤其体现在数学与编程。

03
当前阶梯

Agent

把推理连接到多步骤行动,让可解决的问题范围继续扩大。

04
下一瓶颈

持续学习

像新员工一样吸收长期上下文,而不是每次都重新被告知一切。

05
非线性阶段

自我迭代

AI 开始显著加速 AI 研究,能帮助开发自己的下一代版本。

06
更远终点

具身智能

进入物理世界,承接衣食住行与具体人力需求。

为什么是“阶梯”

每一步都建立在前一步上

Agent 需要思维链,思维链需要语言模型。新范式不是推翻旧范式, 而是把上一阶段的能力变成更高一层的基础设施。

为什么持续学习优先

先让 AI 帮助研究 AI

下一版模型的第一目标被表述为“自己先好用”: 如果它能提升 DeepSeek 开发再下一版模型的效率, 研发速度将从线性变为非线性。

为什么具身在后

把最苦的工程留给更强的 AI

如果先完成持续学习和自我迭代,再进入机器人与物理世界, 前一阶段的智能就能协助完成后一阶段的工程,路线会更省力。

资源现实

人才不是瓶颈,
算力才是

讲话把中美模型能力、实验密度乃至人才培养差距,最终都归因到算力资源。 中国并不缺同等聪明的人,却缺少让研究者反复试错、训练更大模型的卡和资本密度。

讲话中的判断资源差距 → 实验差距 → 人才经验差距 → 模型差距
现有规模(录音时点)≈ 2 万张

H 系列等效算力;相当一部分被称为近期刚到。

超大模型训练估算5 万张

GB300;或约 20 万张华为 950,仅指训练。

现实追赶叙事6–18 个月

用显著更少的算力换取时间差,再逐步缩短。

硬件生命周期判断5 年 / 3 年

英伟达卡约五年折旧;华为卡最多约三年。

国产算力

生态问题正在变成产能问题

讲话认为 CUDA 的护城河正在变弱:AI 能帮助编写生态代码, 专用计算芯片也不必继续与游戏卡架构深度耦合。 DeepSeek 选择通过高级语言与编译工具降低对 CUDA 生态的依赖, 再把同一套方法迁移到国产卡上。

对华为 950 的判断是:任务层面可替代,但大约需要四张卡对应一张 GB300, 且代际落后约两年。讲话并不否认硬件差距, 但判断生态适配有机会在较短时间内被验证,随后真正的限制将是产能。

敏感数字提醒:上述卡量、型号、时间与等效关系均来自录音转写,并可能存在口误或识别误差; 它们用于还原讲话脉络,不应被当作当前采购、库存或性能的正式披露。

组织方式

一半做“正事”,
一半自由探索

“我们最大的核心利益是要保持团队的稳定性。 这是我们最大的核心利益,甚至可以认为是唯一的核心利益。”

—— 梁文锋,录音转写
≤ ½
从上到下

做“正事”

发布模型等全公司目标需要明确分工和协同。 讲话中的理想上限是:这类被安排的任务不要占满员工时间,最好不超过一半。

≥ ½
从下到上

自由探索

另一半时间由研究者判断什么重要、自己去做; 只要算力与公司条件允许,甚至不需要事前协调。

01

没有 KPI,不等于没有方向

方向来自共识与行动中的愿景。重大决策要先寻找团队共识, 创始人的影响力也被描述为建立在这种共识之上。

02

松弛是研究条件

不提倡加班,一是研究需要兴趣与持续思考的空间; 二是公司主动不做很多事,聚焦本身就减少了工作量。

03

稳定比资源更难替代

只要关键团队不散,钱和卡可以补,挫折只会让进度晚半年或一年; 因此期权、使命感与环境共同服务于人才留存。

04

规模扩大后会变形

“没有组织架构”不是永恒教条。讲话承认人员增加后, 部分部门需要严谨层级,另一些研究部门则继续保持扁平。

问答摘录

八个值得保留的
细节判断

01

开源会不会伤害 API 与 C 端生意?

讲话中的判断是否定的。理由不是“开源没有成本”,而是模型部署本身仍有工程、组织和成本门槛;如果官方服务只赚合理利润,第三方很难仅凭开源权重在成本上形成优势。讲话还明确称,开源模型与自部署模型应当一致,不用一个更差的版本换取商业保护。

02

最强模型会不会继续开源?

讲话给出的倾向是“会”,并把帮助社区正确复现、部署和优化成本视为开源的一部分。需要注意,这是一场交流中的方向性表述,不等同于带日期和版本号的正式发布承诺。

03

大模型竞争最终差在哪里?

归纳为三项:成本、时间、用户体验。长期看模型能力差距可能收敛,能否以更低成本提供同等质量、能否早几个月做出来,可能比单一 benchmark 更本质;体验形成的粘性存在,但被判断为次于前两项。

04

中国模型产业会如何收敛?

讲话认为 AI 人才短缺是阶段性的,两三年内会被快速培养补上;真正的问题是基础模型公司过多、资源分散。其推测是最终收敛到三四家,可能由两家大公司与两家创业公司形成充分竞争。

05

Scaling 到头了吗?

至少在讲话者所处的资源尺度上,没有看到上限。当前模型大小被描述为“资源决定的结果”,并非判断该尺寸已经足够;中国团队距离硅谷讨论的 Scaling 上限还很远,算力而不是理论信念构成主要限制。

06

后训练、幻觉和高质量数据怎么看?

幻觉被视为可通过更好的 post-training 改善的长期问题,但不是当下最核心的研究主线。高质量数据标注则被认为既贵又耗时:中国在高端标注上并无天然成本优势,真正瓶颈更像组织时间,而不是一次性增加资本。

07

垂直 Agent 与产品线的优先级是什么?

现阶段更倾向先做通用 Agent,尤其是 Coding Agent;金融、法律、医疗等纵向应用被放在更低优先级。多模态会做,但被定义为组件,而不是抬高智能上限的主线本身。

08

科研理想与资本市场如何共存?

讲话给出的“保底”是 API 与现有 C/B 端基础:即使技术不再出现新突破,全力把 API 服务做好,也可能支撑一家商业公司;更大的梦想则仍是 AGI。两者的平衡不是拒绝商业,而是决定什么时候赚、赚哪一部分、赚到什么程度。

A WAY TO READ IT

这场长谈真正想解释的,
不是“DeepSeek 为什么便宜”,
而是“一个组织为什么愿意便宜”。

低价、开源、不抢全部用户、少做产品线、不加班、保留自由探索时间—— 这些表面分散的做法,在讲话中都被收束到同一套自我叙事: 用克制换取更长的时间、更稳定的团队与更高的 AGI 成功概率。

是否认同这套判断可以讨论;但理解它,才能理解这段录音里每一个商业、 技术和组织答案为什么彼此一致。

返回顶部 ↑