八千代Yachiyo
← 返回文章列表
AIDeepSeekAGI

DeepSeek 的愿景、算力约束与 AGI 路线选择

·Yachiyo
DeepSeek 的愿景、算力约束与 AGI 路线选择

DeepSeek 的低成本不是目的,是算力受限下的必然选择。梁文锋把 AGI 能力阶梯(推理 → Agent 工具使用 → 持续学习 → 自我迭代)当作唯一主线,商业化、视频生成、C 端产品都是次要的——因为这些方向不直接抬高智能上限。开源和低价是扩大使用而非牺牲利润,愿景在这里承担了具体的组织功能:面对每一个分叉时,它是 DeepSeek 没有偏航的原因。

DeepSeek 那场投资者交流里,最值得注意的地方,不只是某个具体模型,也不只是开源、低价、API 定价这些容易被传播的策略。真正贯穿整场交流的,是梁文锋反复提到的那个词:愿景。

这个词在很多公司语境里已经被用得很空。它经常出现在官网、融资稿、年会 PPT 或企业文化手册里,听起来很大,落到现实里却很轻。但在 DeepSeek 这场交流里,“愿景”有很具体的重量:它决定公司到底应该把时间、人才、算力、资金和组织注意力压到哪里。

梁文锋对 DeepSeek 的定位很清楚。公司的重心放在 AGI 这条主线上,B 端销售、C 端增长、API 收入、商业利润都可以存在,也都重要,但它们更像是路上自然长出来的结果。DeepSeek 当然还是一家商业公司,需要现金流,需要活下去,也需要用收入支撑长期研发。只是它没有把“卖什么产品”“拿多少客户”“做多大收入”放在最前面,交流中反复回到一个更底层的问题:什么能力真正接近通用智能?

这个问题决定了 DeepSeek 选择做什么,也决定了它选择不做什么。

算力稀缺,是理解 DeepSeek 的第一层背景

如果只看模型发布和榜单,很容易把 DeepSeek 的成绩理解成一次技术爆发。但放回国内 AI 产业的现实环境里,它更像是在硬件约束下形成的一整套战略结果。

国内现在面对的算力环境非常现实。高端英伟达卡可获得量有限,先进芯片受出口限制影响明显;国产 AI 芯片有机会,但数量、生态、软件栈、集群稳定性都还在追赶。对很多公司来说,钱本身还不够,真正困难的是把钱顺利变成足够多、足够稳定、足够好用的算力。

这和美国头部 AI 公司所处的环境完全不同。美国公司可以依赖更完整的 GPU 供应、云基础设施、网络互联、数据中心体系和资本市场支持。它们可以同时推进基础模型、多模态、企业产品、消费端应用、视频生成、搜索、Agent、硬件合作和生态平台。资源充足会带来更大的试错空间,也允许组织在多个方向上并行下注。

DeepSeek 面对的是另一种局面:算力少,资源紧,硬件不确定性高,很多选择都必须更克制。

这种克制不是风格问题,已经接近生存问题。算力稀缺会逼迫一家公司反复追问:每一单位算力花在哪里最值得?每一条产品线会不会稀释主线?每一个商业机会会不会带来额外组织负担?如果模型能力本身还没有到达下一个台阶,过早扩张产品和销售会不会把公司拖向另一个方向?

所以 DeepSeek 的路线选择很大程度上是在回答一个问题:

当我们没有美国公司那样的算力储备时,怎样还能持续逼近智能上限?

答案显然不会是简单地“堆更多卡”。在算力不可自由获得的前提下,效率、架构、训练方法、推理系统、工程优化、组织专注度,都会变成核心竞争力。

这也是 DeepSeek 让人觉得特殊的地方。低成本只是外界看到的标签,背后是一整套资源约束下的能力建设方式。

商业化会改变优化目标

梁文锋在交流里提到,如果 DeepSeek 是一家更追求商业化、追求利润最大化的公司,可能达不到现在的模型能力。这个判断听起来有点反直觉,因为商业化通常意味着更多收入,更多收入理论上可以购买更多算力、招更多人、做更多研发。

但现实没有这么线性。

商业化会带来收入,也会带来一整套新的组织重心。公司一旦开始强力追求 B 端和 C 端增长,就会自然产生大量需求:销售团队、客户成功、私有化部署、行业方案、定制功能、产品矩阵、用户运营、增长指标、渠道合作、融资叙事。每一项都合理,每一项都能解释为公司发展所需。问题在于,它们会持续消耗最稀缺的资源:核心团队的注意力。

尤其在算力受限的环境里,资源分流的成本会被放大。

如果 DeepSeek 早早转向强商业化,它很可能会被推向一些更容易变现、也更容易被大众感知的方向。例如 C 端产品、办公工具、知识库、搜索、图像生成、视频生成、企业解决方案。这些东西都有市场,也都可能做成很大的业务。可是它们未必直接提高模型的智能上限。

这就是梁文锋观点里很重要的一层:商业价值和智能主线并不总是重合。

很多 AI 产品能很快获得用户反馈,也能让市场感到兴奋。图像生成、视频生成、PPT、文案、客服、办公自动化,这些方向都容易被看见,也更容易转化成收入。但 AGI 需要解决的是另一组问题:推理、规划、工具使用、长期记忆、持续学习、自我改进、开放环境中的任务执行能力。

这两组问题有交集,但不能混为一谈。

一家公司如果没有清晰愿景,很容易被短期反馈牵引。用户喜欢什么就做什么,客户愿意付钱就交付什么,市场热点在哪就追什么。每一步都合理,最后却可能走成一家很成功的 AI 应用公司,离最初设想的 AGI 主线越来越远。

DeepSeek 反复强调愿景,本质上是在给组织设定一种免疫系统。它让公司在面对资本、客户、流量、媒体和短期收入时,仍然知道哪些事情该做,哪些事情现在不能做,哪些事情即使赚钱也不应该成为主线。

图像、视频与“智能主线”

交流里有一个很容易引起争议的观点:梁文锋对图像生成、视频生成这类能力并没有表现出太高优先级。在他的判断里,这些更接近大众需求明确的产品能力,优先级低于通往 AGI 的核心台阶。

这个判断如果用强版本理解,会显得偏窄。因为人类智能显然不只存在于语言里。真实世界智能涉及视觉、空间、时间、物理、动作、因果关系和多模态反馈。视频理解、世界模型、具身智能这些方向,长期看很可能和 AGI 密切相关。一个真正理解世界的系统,最终不能只处理文本。

但如果把他的表达放回公司战略层面,会更容易理解。

他关注的重点不在“图像和视频有没有价值”,更在“DeepSeek 此刻应该把最稀缺的资源押在哪里”。当前许多图像和视频生成路线,更多在解决生成质量、画面一致性、可控性、商业素材生产、娱乐内容消费这些问题。这些方向很重要,也有巨大市场,但未必是提高通用智能上限的最短路径。

一个模型能生成漂亮视频,不代表它已经能在开放环境里完成复杂任务;能生成逼真图像,也不代表它具备长期规划、持续学习、自我纠错和跨任务迁移能力。视觉生成可以是智能的一部分,但视觉产品化不一定等于智能突破。

所以 DeepSeek 的取舍更像是一种阶段性判断:在资源有限时,优先做更直接抬高智能上限的事情。

这更像是对公司边界的确认,而不是对多模态价值的否定。DeepSeek 没有必要为了迎合市场热度去做所有 AI 产品。它要保持主线,就必须忍住一些看起来很诱人的机会。

这种“不做什么”的能力,往往比“做什么”更难。

DeepSeek 的能力阶梯

从那场交流里看,梁文锋对 AI 发展的路线有一条很清楚的阶梯:

基础设施 → 基础模型能力 → 推理 → Agent 工具使用 → 持续学习 → 自我迭代 → AGI

这条路线值得认真看,因为它关注的是能力递进,而不是产品矩阵。

基础设施解决的是效率问题。训练系统、推理系统、集群调度、通信优化、算子优化、成本控制,这些事情不直接出现在普通用户面前,却决定了模型能力能不能持续往上走。国内算力不足时,基础设施的重要性会进一步提高。卡少,就要把每张卡榨得更干净;生态弱,就要自己补工程能力;硬件受限,就要尽量减少浪费。

基础模型能力是智能的底座。语言、知识、代码、数学、泛化能力、指令跟随,这些能力构成了模型能够理解和处理任务的基础。没有足够强的底座,后面的推理和 Agent 都很难稳定。

推理是第一个关键台阶。CoT、数学、代码、复杂问题拆解,本质上提高的是模型单次思考的深度。它让模型摆脱单纯的模式补全,开始沿着问题结构逐步展开,处理更长链条、更高难度、更少模板化的任务。

Agent 是第二个关键台阶。模型一旦能调用工具、读写文件、使用浏览器、执行代码、操作外部系统,它就开始从回答问题走向进入环境。Agent 把模型从“对话接口”推向“任务执行系统”。它让 AI 可以和真实工具链连接,可以完成多步骤任务,可以把语言能力转化成外部动作。

持续学习是更难的一跳。现在的大模型大多还是静态能力快照:训练一次,部署使用,通过上下文临时适应,再等待下一轮训练或微调。真正的持续学习意味着模型能从经验里积累,能记住有价值的东西,能修正过去的错误,能把任务反馈转化成未来能力。

这一点非常接近 AGI 的核心。人类智能并非一次性训练完成,人会在环境里持续学习、反思、迁移和成长。如果 AI 不能持续学习,它就很难真正具备长期适应能力。

更进一步,就是 AI 参与改进 AI。

如果未来模型能参与写训练代码、优化推理内核、设计实验、分析失败原因、生成高质量数据、改进评测、阅读论文、复现实验、提出新算法,那么 AI 研发会进入一个反馈循环:更强的 AI 提高 AI 研发效率,更高效的研发带来更强的下一代 AI。

这条路线真正值钱的地方,就在于长期复利。

推理让模型更会思考,Agent 让模型能执行任务,持续学习让模型有机会越用越强,自我迭代让能力提升从线性走向循环。这比单独做某个热门产品更接近 AGI 主线。

开源、低价与克制

DeepSeek 的开源和低价,经常被外界单独拿出来讨论。但放回这套路线里,它们都属于愿景的一部分,并不是孤立策略。

开源带来的远不止声量。它能让更多开发者、研究者和公司参与进来,形成生态反馈,也能增加信任。对一家追求 AGI 主线的公司来说,开源是一种战略克制:不试图把所有价值都锁在自己手里,而是把模型能力释放出去,让更多真实场景帮助检验模型、使用模型、改进模型周边生态。

低价也是类似逻辑。API 定价如果只追求利润最大化,当然可以更贵。但 DeepSeek 的思路更接近“合理利润 + 扩大使用”。模型越便宜,越容易进入真实工作流;使用场景越多,反馈越丰富;生态越活跃,长期影响力越强。

当然,这里面有平衡。DeepSeek 仍然需要商业收入,需要支撑算力、人才和长期研发。纯粹理想主义无法维持一家高强度 AI 公司。但如果商业化目标压过技术主线,公司就会逐渐改变形态。

所以开源、低价、克制利润、少做产品、聚焦主线,这几件事其实是一套组合拳。它们共同服务于一个目标:提高做成 AGI 的概率。

国产芯片与硬件垄断的缝隙

交流里关于国产 AI 芯片和 TileLang 的部分也很重要。

在高端 GPU 受限的背景下,国产芯片不只是供应链替代问题,也关系到国内 AI 公司能不能拥有长期自主的算力基础。过去国产芯片最大的挑战之一是生态。硬件本身很重要,但软件栈、开发工具、算子库、编译器、调试体验、模型适配和集群稳定性同样关键。

英伟达强大的地方不只是芯片性能,还有 CUDA 生态形成的巨大惯性。开发者习惯、框架支持、算子优化、工具链成熟度,会共同构成硬件垄断的一部分。

梁文锋提到 TileLang,本质上是在说生态迁移的机会。更高层的算子表达、更少的代码量、更容易跨硬件适配,可能会削弱 CUDA 的锁定效应。即使短期有一点性能损失,如果能换来更强的开发效率和迁移能力,也可能是值得的。

这点和 DeepSeek 的整体战略是一致的:在硬件受限时,不能只等外部环境改变,还要主动在软件层、工具层、工程层寻找突破口。

国产 AI 芯片是否能真正跑出来,还要看生态、产能和市场验证。但可以确定的是,硬件垄断越强,国内公司越需要在模型效率、推理系统、编译工具、算子语言和软硬件协同上投入。

DeepSeek 对这件事的重视,说明它看见了 AGI 路线背后的基础设施战争。

愿景作为组织的方向感

很多时候,愿景听起来像一个抽象词。但在 DeepSeek 这里,它其实承担了非常具体的组织功能。

它决定公司不被短期收入牵着走;决定团队在资源紧张时优先保住主线;决定哪些产品机会可以暂时放下;决定开源和低价为什么能成立;也决定公司如何面对算力不足和硬件垄断。

如果没有这个方向感,DeepSeek 很容易变成另一种公司:一家模型能力不错、商业化很积极、产品线很多、收入增长也很漂亮的 AI 应用公司。那样的公司当然也有价值,只是它未必还能持续把资源压到 AGI 最关键的能力台阶上。

梁文锋强调愿景,是因为 AGI 这条路太容易被干扰。资本会要求增长,客户会要求交付,用户会要求体验,媒体会追逐热点,组织会倾向于扩大自己的职责范围。每一种力量都合理,但叠加在一起,就会让公司偏离最初的问题。

愿景的作用,就是在这些力量之间划出边界。

我对这场交流的理解

我觉得 DeepSeek 真正值得讨论的地方,不只是它做出了什么模型,也不只是它价格多低、开源多彻底。更重要的是,它展示了一种在算力受限环境里的 AGI 公司路线:把有限资源尽量投入到最能提高智能上限的地方。

硬件约束在这里不只是一个限制条件,它本身就在塑造决策。因为卡不够,所以每一分算力花在哪里都得想清楚。因为商业化会稀释注意力,所以能赚的钱也得挑着赚。因为主线足够长,所以开源和低价反而成了扩大影响的方式,而不是牺牲。这些选择彼此之间有内在逻辑,不是几个孤立的策略凑在一起。

所以我不太愿意把 DeepSeek 的故事简单归结为"低成本做出了强模型"。这个说法不算错,但太表层了,抓住的是结果而不是原因。

背后更完整的东西是:一家公司在资源不占优的情况下,靠着对路线的判断和对组织注意力的管控,持续把资源压在最关键的地方。这件事本身比任何一个模型发布都更难,也更值得认真对待。

愿景这个词在那场交流里之所以显得有分量,不是因为它听起来宏大,而是因为它在现实里真的在起作用——它是 DeepSeek 面对每一个分叉时的决策依据,也是它到目前为止没有偏航的原因。