Skip to content

一个“低占有欲”公司的巨大野心 ​

这不像一场常规的投资者沟通,更像创始人在公司真正变大之前,试图先和资本签下一份关于边界的契约。

阅读范围与核验边界

本文是作者对梁文锋投资者交流会的个人理解,只分析会议记录所呈现的思想与内部逻辑。文中涉及的算力、收入、模型进度、硬件性能及其他具体数字,均按会议记录中的说法讨论,未逐项进行外部核验,也不构成事实背书。

通常,投资者交流会关心的是公司准备进入哪些市场、如何扩大用户、怎样提高收入、未来能拿走多大份额。梁文锋花了相当多的篇幅回答另一个问题:有哪些钱可以不赚,哪些机会可以不抓,哪些能力即便拥有,也不急着变成自己的地盘。

这很反常。一个创业者在融资时,往往要证明自己有足够强的扩张欲。他却反复谈克制,谈开源,谈低价,谈不抢用户,谈不做过多产品,甚至谈“不加班”。但若把整场讲话连起来看,这些说法并不松散。它们都指向同一个焦虑:

一家以长期研究为目标的公司,怎样避免被自己的早期成功带偏?

最危险的时刻,是成功来得太早 ​

DeepSeek 真正面临的风险,未必是模型做不出来、资金不够或者用户不来。

更棘手的风险,反而来自模型突然走红。

一家公司没有用户时,目标通常很单纯。研究团队只需要考虑模型能力、算法效率和下一轮实验。用户一旦涌入,组织的重心便会自然移动:服务器要扩容,客服要增加,产品需要打磨,增长团队开始研究留存,商业部门开始寻找广告、电商、会员和企业服务的可能性。

这些事情每一件都有道理。问题在于,它们会在公司内部长出自己的利益集团。

产品负责人希望产品更完善,销售团队希望模型更适合签单,运营团队希望留住更多用户,财务部门希望收入更加稳定。时间一长,原本为研究服务的商业系统,可能反过来要求研究团队服务它。

很多公司的路线并非被某个错误决定扭转,而是在无数个合理的小决定中慢慢偏航。

梁文锋把 C 端流量和 B 端收入形容为路边的“芝麻”,把 AGI 看成后面的“西瓜”。这听起来像一种机会大小的比较,其实还包含更深的组织判断:一旦停下来认真捡芝麻,公司很可能就此变成一家熟练捡芝麻的公司。

它会招聘最会捡芝麻的人,建立一套衡量芝麻产量的指标,形成围绕芝麻分配资源的部门,最后再也舍不得离开那片地。

所谓克制,首先是一种防止路径依赖的手段。

DeepSeek 当然没有完全放弃用户和收入。它保留 C 端服务,也提供 API,还希望收入能够覆盖研发。区别在于,它不愿让这些业务获得定义公司方向的权力。

商业化可以养活研究,不能接管研究。

这条边界说起来很清楚,守起来极难。原因也简单:短期收入是确定的,长期技术突破带有很大的不确定性。季度报表能被量化,AGI 何时出现没人说得准。组织一旦承受经营压力,资源总会流向更容易解释、更容易考核、更容易交付的事情。

因此,这场交流真正想说服的,可能不只是投资人相信 DeepSeek 会赚钱,还包括另一层意思:即使赚钱,公司也不准备把“赚更多钱”升级为最高目标。

愿景只在需要付出代价时才是真的 ​

梁文锋对“愿景”的理解,与企业宣传册中的愿景有很大差别。

很多公司也会写“改变世界”“服务人类”“让技术普惠”,可这些词通常不会影响实际决策。业务增长与口号发生冲突时,口号总会让路。愿景留在墙上,资源流向财务回报更高的地方。

DeepSeek 的特殊之处,在于它试图通过一系列有成本的选择,让员工相信这套愿景确实拥有约束力。

开源最强模型,是有成本的。

降低 API 价格,是有成本的。

用户突然增长时不大举抢占流量,是有成本的。

不给所有研究设定短期 KPI,意味着公司必须承受一部分不可预测和不可量化的投入。

让研究人员保留较多自由时间,也意味着组织放弃了表面上更紧凑的产能管理。

愿景一旦需要公司主动放弃某些现实利益,它就不再只是语言表达,而会成为可信的承诺。

员工真正相信的,从来不是管理层说过什么。他们看的是公司在面临诱惑时如何选择。

模型降价后,团队内部感到高兴,这个细节很有意思。一般公司降价,员工首先想到的是收入下降、奖金受损、估值承压。这里的员工却把降价理解为自己的工作终于被更多人用得起。它说明组织成员从工作中获得的回报,不完全来自工资、职级和股权,也来自一种较强的价值认同。

这种价值认同本身就是组织资源。

前沿研究高度依赖人的主动性。研究员面对一个没有标准答案的问题时,管理者很难通过流程逼出真正的创造力。公司可以要求一个人完成多少实验,却无法命令他产生一个好想法。共同愿景在这里承担了部分管理功能:它让成员愿意在没人监督的情况下持续思考,也让人对枯燥、失败和不确定有更高的容忍度。

从这个角度看,DeepSeek 所谓“没有组织”,当然是一种夸张。它并非毫无组织,只是把一部分显性的规章、层级和考核,换成了隐性的共识、声誉和同行判断。

这种方式在小规模团队中很有效。大家长期共事,对什么问题重要、什么结果可信、谁擅长什么都有共同理解。随着人数增加,问题会迅速复杂起来。

愿景会出现不同版本。

有人把自由理解成主动承担,有人把自由理解成不必交付;有人把开源理解成长期使命,有人只把它当作获客策略;有人愿意为了 AGI 忍受多年不确定性,也有人更关心眼前收入和个人发展。

公司规模越大,越不能只靠“大家大体上都明白”。

DeepSeek 未来最难的组织课题,不是简单地建立层级,而是把早期共识沉淀成一套不会伤害研究文化的制度。制度太弱,协作会失灵;制度太强,研究团队会逐渐变成项目交付团队。

最值得建立的,或许不是一套非常详细的行为手册,而是一部简洁的“负面宪法”:明确哪些事情即便赚钱也不优先做,哪些权力即便公司拥有也不轻易使用,哪些短期目标不能压倒长期研究。

强文化未必要求所有人对未来有完全相同的想象。很多时候,大家共同知道什么不该做,已经足以形成稳定边界。

“克制”首先是对组织欲望的管理 ​

克制很容易被理解成一种道德姿态:企业愿意少赚一点,让社会多得一点。

这当然是讲话的一部分,但还不够。

梁文锋所谓的克制,更接近一种关于公司欲望的管理。公司和个人一样,欲望会自我繁殖。获得用户之后想要流量,获得流量之后想做广告,掌握模型之后想进入应用,进入应用之后想控制渠道,拥有渠道之后又想进入硬件和基础设施。

每一步都能找到商业理由,最后公司会变成一个什么都做的庞大系统。

组织一旦习惯扩张,就很难主动停下来。某项业务只要产生了收入,就会有员工、预算和管理者围绕它存在。关闭这项业务不再是砍掉一个项目,而是触动一批人的职业前途和内部权力。

因此,克制真正减少的是未来的组织负担。

DeepSeek 不愿意做所有 AI 产品,不愿向上下游全面垂直整合,也不愿把用户流量迅速变成一套庞大的商业体系。它省下来的不只是资金,还有管理注意力、部门协调成本和内部政治成本。

这解释了梁文锋为什么会把克制和“不加班”联系起来。

不加班并不完全来自人文关怀,也来自公司主动缩小了任务清单。什么都想做的组织永远忙不过来。它会不断增加项目、会议和协同,最后每个人都在为庞大的业务边界付出时间。

聚焦往往被理解为把最重要的事情做好。这里还可以再向前一步:聚焦的本质,是持续拒绝那些同样有道理、同样有市场、同样可能赚钱的事情。

一家公司真正的战略,不写在它选择了什么上面,更清楚地写在它长期拒绝了什么上面。

低占有欲并不等于没有野心 ​

梁文锋的表达中有一种很有意思的张力。

一方面,他不断降低公司应当占有的利益份额,强调只拿合理利润,不独占产业价值,不与所有合作伙伴竞争。

另一方面,他对 AGI 的目标极其坚定,甚至认为只要团队保持稳定,最终做成只是时间问题。

这是一个“低占有欲、高目标感”的组合。

通常,人们会把野心和占有联系在一起:想做大,就要拿更多市场;想领先,就要控制更多资源;想成为伟大公司,就要进入更多业务。

DeepSeek 提供了另一种想象。它的野心落在技术结果上,而非企业疆域上。公司希望推动通用智能,却不要求所有应用、用户、数据、芯片和利润都集中到自己手里。

可以把它理解成一家“有限责任的基础能力公司”:把最核心的模型能力做好,让大量外部企业负责把能力变成产品、行业方案和现实服务。

这套思路在 AI 行业有一定现实基础。AI 可能形成极大的经济价值,一家公司即便只占很小比例,也足以获得可观收益。既然总蛋糕巨大,就没必要为了提高几个百分点的占有率,把整个生态变成敌人。

梁文锋提出“拿得少的人会打败拿得多的人”,背后是一种很朴素的竞争逻辑:当几家供应商提供的能力接近,愿意接受较低利润的一方,可以用低价和开放持续压迫高利润一方。只要服务能够维持,市场就会不断把超额利润削薄。

这套逻辑成立,需要几个条件。

模型能力不能长期出现无法追赶的巨大差距;客户迁移成本不能高到足以锁死市场;企业也不能掌握别人永远无法获得的独占数据和网络效应。

一旦某家公司真正形成不可替代的封闭优势,“少拿一点”未必自动带来胜利。微软、苹果、谷歌等公司的历史都说明,平台、生态和分发渠道可以长期支撑很高的利润率。

因此,“拿得少的人终将胜出”更像一种战略信念,不能被当成普遍定律。

不过,它仍然揭示了 AI 行业的一个重要现实:模型越接近基础设施,社会越难接受单一公司长期收取极高租金。开发者、客户、政府和竞争者都会寻找替代方案。过度攫取可能带来短期利润,也会制造强大的反作用力。

克制在这里是一种降低系统阻力的方法。

公司少占一点,合作伙伴就多一些生存空间;模型更开放,开发者更愿意投入;价格更低,用户更敢把业务建立在上面;竞争者不必把 DeepSeek 视为必须消灭的敌人。

一家企业未必需要得到所有人的热爱,只要能减少所有人联合对抗它的动机,长期处境就会轻松很多。

开源真正交出去的是静态成果,留下来的是迭代能力 ​

很多人讨论大模型开源时,仍然沿用传统软件的理解:核心代码公开之后,护城河就被拆掉了。

梁文锋显然不这么看。

在他的逻辑里,模型权重属于某一时点的静态成果。企业真正的竞争力存在于一个持续运动的系统中:研究判断、训练方法、数据处理、推理优化、硬件调度、工程基础设施、组织协作,以及推出下一代模型的速度。

别人可以获得你今天的模型,却无法因此自动拥有你明天的模型。

从这个角度看,开源并非把公司最重要的资产全部赠送出去。它更像定期公开一张照片,而企业真正的生命力存在于照片背后那个仍在生长的组织。

一家开源模型公司必须把护城河从“我知道而你不知道”,迁移到“即使你知道,我依然做得更快、更便宜、更稳定”。

这类护城河更辛苦。秘密可以被锁在服务器里,能力必须每天重新证明。

它也更健康。依靠封闭获得优势,公司容易把注意力放在控制访问、提高价格、制造迁移障碍上。依靠效率获得优势,组织必须不断优化架构、降低成本、改进服务。

开源还会迫使公司面对一个残酷问题:把模型交给全世界之后,自己还剩下什么?

若答案只是品牌和先发声量,这个商业模式很脆弱。若答案包括更快的研发节奏、更低的部署成本、更强的官方服务和更成熟的硬件适配,那么开源反而会放大优势。

DeepSeek 承诺开源模型与自身部署模型一致,这一点尤其关键。很多所谓开源更接近营销行为:释放较弱版本,核心能力仍然封闭。长期下来,社区会怀疑企业把开放当作吸引注意力的工具。

“开源即自用版本”构成了更强的信誉承诺。它让外界相信,公司不会在获得生态之后突然切换规则。

当然,开放也会把企业暴露在更高压力下。

一旦迭代速度放慢,社区和竞争者可能迅速追上;一旦其他团队在开源模型上做出更好的版本,原创者未必能保住中心位置;能力越强,安全与滥用问题也越难回避。

开源公司没有资格停滞。它把自己放进了一个必须持续奔跑的制度里。

所以,开源看似宽松,内部要求反而更苛刻。它不允许公司长期躺在上一代成果上收租。

低价既是善意,也是对自身效率的强制训练 ​

梁文锋提出以设备大约十个月回本作为定价参考。他当然知道,市场能够承受更高价格,价格提高后需求也未必明显下降。公司仍然选择较低价格,因为当前收益已经足以支持经营。

这里有一种主动放弃“用户愿意多付多少”的定价方式。

传统商业逻辑强调支付意愿。只要客户离不开产品,公司就有理由把价格提高到需求开始明显下降的位置。梁文锋给出的参照点更接近成本、风险和合理回报。

这个标准未必天然公正。“十个月”为什么比八个月或十四个月合理,仍然带有主观判断。设备折旧、研发投入、资本成本、免费用户支出和未来风险,也都可能改变价格边界。

它真正重要的地方,不在于十个月这个数字本身,而在于公司给自己设置了一个锚。

没有这个锚,定价会不断滑向机会主义:既然客户愿意付,就再多收一点;既然竞争对手更贵,就没必要降价;既然市场火热,就先把利润拿到手。

企业很容易把任何更高价格解释为“合理”。

一个公开或半公开的内部标准,至少能让团队在涨价之前回答:成本真的变了吗?研发负担真的增加了吗?继续提高价格究竟是为了持续经营,还是仅仅因为拥有定价权?

低价还会反过来改造公司的技术路线。

当企业不能依靠高价覆盖低效率时,它只能认真优化模型架构、显存占用、推理框架、并行方式和硬件利用率。成本不再是财务部门的指标,会变成研究部门必须处理的核心问题。

这也是 DeepSeek 与许多高毛利软件公司的差别。软件复制成本接近于零,企业可以在较长时间内忽略底层效率。大模型每一次调用都消耗真实算力,成本结构始终存在。谁能把同样能力压缩到更少计算中,谁就获得了更大的生存空间。

更深一层,低成本不仅决定服务价格,也决定研究速度。

训练一次实验更便宜,团队就能做更多实验;实验数量增加,对模型规律的理解会更快;理解加深后,又能继续提高效率。

算力不足时,效率优化相当于给研究团队创造额外的试错次数。

所以,中美之间真正重要的差距,不能只理解成谁拥有更多显卡。算力决定了一个组织有多少次犯错的机会。

有五万张卡的团队可以同时尝试十种路线,九种失败后仍然留下一个结果。资源紧张的团队可能只能选择两种。它不仅更难获得突破,也更难判断自己失败的原因。

研究能力很大程度上来自高频反馈。算力让组织更快形成关于世界的判断。

这也是为什么资源差距最终会表现成人才差距、模型差距和工程差距。年轻研究员只有参与足够多的真实实验,才能形成判断力。没有机器,就没有实验;没有实验,人才成长只能停留在纸面上。

资源匮乏会塑造技术风格,也会塑造价值观 ​

梁文锋反复强调低成本、计算效率和国产硬件适配。这当然可以被解释为愿景:让更多人用得起模型。

它同样是现实压力的结果。

美国头部公司拥有更充足的资本和算力,可以先用规模解决问题。中国团队拿不到同等资源,只能更早关注算法效率、训练技巧和推理优化。

久而久之,约束会变成风格。

日本制造业曾在能源和空间受限的环境中发展出对精益、节省和小型化的偏好。中国 AI 公司也可能在算力受限的条件下形成一种独特技术品味:同样效果能不能少用一些参数,同样任务能不能减少计算,同样模型能不能部署在更多硬件上。

这种风格有机会发展成长期优势。大量市场并不需要最昂贵、最大的模型,而需要足够好、便宜、稳定、可部署的能力。

但也要警惕把资源不足浪漫化。

巧妙的方法能够缩小差距,无法无限替代绝对规模。某些能力可能只有在更大模型、更大数据和更多实验下才会出现。若算力长期相差一个数量级,中国团队可能在局部效率上领先,却仍然难以全面探索最前沿的能力边界。

“用二十分之一算力晚一年追上”是一个有吸引力的叙事。问题在于,追赶者看到的往往是领先者已经公开的方向。真正决定下一轮竞争的,恰恰是那些尚未被公开、尚未被证明的探索。

资源不足的一方更擅长优化已经知道有效的路线,资源充足的一方则拥有更大的自由去寻找下一条路线。

因此,效率和规模不是二选一。效率让有限资源产生更高产出,规模决定团队能探索多少未知空间。

DeepSeek 若想从追赶者变成长期引领者,最终仍然需要更多算力。会议中那种“能买多少就买多少”的态度,也说明公司对此并不浪漫。

持续学习之所以关键,因为真正的工作依赖漫长的共同生活 ​

整份交流中,关于 AGI 最有穿透力的例子,不是什么复杂数学问题,也不是模型能否获得更高考试分数,而是一个极其普通的场景:

你对员工说“把小王叫过来”,他知道小王是谁。

这是当前 AI 与真实组织之间的距离。

人类工作依赖大量没有被写下来的上下文。员工知道公司过去发生过什么,了解同事的性格和职责,明白一句简短指令背后的历史,也记得哪些方案曾经失败。很多知识并不存在于数据库中,它散落在会议、关系、经验和共同生活里。

现有 AI 在上下文完整时表现惊人。问题是现实中几乎没有完整上下文。

我们无法每次下达任务前,把公司几年的历史、所有人际关系、过去决策和隐含规则重新输入一遍。即便技术上能塞进超长窗口,信息堆积也不等于真正理解。重要的是知道什么值得记住、哪些经验已经过时、哪些例外不能被当成规则。

因此,持续学习远远不只是“增加记忆功能”。

一个系统若要在组织中长期工作,需要建立某种连续的身份。它得记得自己做过什么,吸收反馈,修正方法,同时保留原有能力。它还要学会遗忘:有些临时信息会过期,有些错误经验不能长期保留,有些敏感信息不应被带到其他场景。

人类员工的价值,很大一部分来自他在环境中生活过。

今天的 AI 更像一个能力很强、每次出现都要重新交代背景的外部顾问。持续学习一旦成熟,它才可能从顾问变成同事。

这也会带来新的治理问题。

一个会持续改变自己的模型,比一个静态模型更难审计。它在不同公司、不同部门生活一段时间后,可能形成不同习惯。谁来确认这些变化是有益的?哪些经验可以进入长期记忆?错误偏好如何清除?一名员工可以被培训和追责,一个持续变化的 Agent 要如何承担责任?

持续学习把 AI 带入真实组织,也会把组织管理、安全和伦理问题一起带进来。

所以,它既是一项技术突破,也是一次制度突破。

尽量少靠人硬做 ​

梁文锋给出的路线大致是:语言模型、思维链、Agent、持续学习、自我迭代,再到具身智能。

这套路线最耐人寻味的地方,不只在技术顺序,还在他解释顺序时使用的词:这样走“比较轻松”。

很多人谈 AGI 时,习惯强调艰难、宏大和极限投入。他却在寻找一条尽量省力的路。

先让模型获得持续学习能力,模型就能帮助研发下一代模型;先形成 AI 辅助 AI 研究的闭环,再进入机器人,未来的机器人研发便可以由更强 AI 参与。每一步都尽量利用前一步的能力,减少纯粹依靠人力、数据和工程堆积的部分。

这种思路很像建造机器的机器。

如果目标是生产更多产品,最笨的办法是不断增加工人;更高杠杆的办法是先改进生产设备。DeepSeek 希望先把“研究工具”变强,再用这个工具解决后续更困难的问题。

这也解释了它为什么把 Coding Agent 放在优先位置。

编程任务结构相对清晰,结果可以运行,错误能够测试,反馈周期较短。模型写出的代码是否有效,往往比一篇报告是否有洞见更容易验证。更重要的是,代码本身就是 AI 研究的基础工具。

一个更强的 Coding Agent 不会只帮助外部程序员,也会帮助 DeepSeek 自己的研究员写训练框架、搭建实验、分析日志、优化推理系统。

模型能力提高,研究效率随之提升;研究效率提升,下一代模型更快出现;下一代模型继续加速研究。真正可能带来非线性增长的地方,就在这个循环里。

但循环并不天然指向正确方向。

AI 帮助 AI 研究,也可能放大旧方法的惯性。模型根据过去代码、过去论文和已有实验模式提出建议,最擅长的往往是对熟悉范式进行组合和优化。真正改变方向的研究,有时来自对主流假设的怀疑,来自不合时宜的问题,甚至来自长期没有结果的直觉。

高效率闭环如果缺少外部刺激,可能变成高速重复。

模型越深地参与下一代模型研发,团队越需要保留异质的人类判断、真实世界反馈和不同研究传统。加速很重要,避免加速驶向错误方向同样重要。

真正稀缺的是判断 ​

梁文锋认为,AI 并不缺品味和直觉,真正缺的是持续学习能力。

这句话很大胆。

模型确实可以写出流畅文章,可以模仿成熟设计,也能在大量候选方案中给出看似不错的选择。它在人类已经建立的审美和知识空间中,拥有很强的归纳能力。

但研究品味可能比一般意义上的“写得好不好”更复杂。

好的研究品味,往往体现在几个方面:能否发现一个尚未被重视的问题,能否判断某项漂亮结果其实没有意义,能否在数据不足时坚持一个暂时不受欢迎的方向,能否意识到行业共同追逐的指标可能已经偏离目标。

这种品味与知识有关,也与一个人长期经历失败、观察现实、承担后果有关。

模型可以学习历史上哪些想法后来被证明正确,却很难直接获得研究者当时面对不确定性时的处境。它擅长从已有分布中识别“像好想法的想法”,真正的突破有时恰恰不像过去任何一个好想法。

当然,持续学习可能改变这一点。如果 AI 能够长期做实验、经历失败、修正判断,它也可能逐渐形成自己的研究品味。

在那之前,人与模型更合理的分工,或许是让模型扩大搜索空间、提高执行效率,由人类负责审视目标、识别异常、承担最终判断。

人类研究者的价值未必永远在于写代码、调参数和读论文。随着这些工作被自动化,人真正稀缺的部分可能越来越集中于:为什么做这个问题,什么结果值得相信,以及我们究竟想把技术带向哪里。

“正事不超过一半”,是一种很奢侈也很聪明的组织设计 ​

DeepSeek 内部所谓两条线很有启发性。

  • 一条线服务确定性交付,例如发布新模型,需要统一计划、明确分工、按时间完成。这部分被称为“正事”。

  • 另一条线留给个人探索。研究员可以自行选择问题,不必事先证明商业价值,也不要求每个尝试进入产品。

梁文锋希望 “正事”占用的时间不要超过一半。

这个比例是否精确并不重要,重要的是它承认:研究组织需要同时经营两种完全不同的活动。

一类活动追求可靠。版本必须发布,系统必须稳定,服务必须运行。

另一类活动追求意外。它的价值恰恰来自无法提前计划。

传统管理天然偏爱第一类活动。交付可以写进甘特图,进度可以汇报,负责人可以追责。探索往往只有投入,没有确定结果。一个研究员几个月没做出成果,管理者很难判断他正在接近突破,还是单纯走错了路。

因此,很多研究型公司随着规模扩大,会逐渐把自由探索压缩掉。项目越来越多,日程越来越满,每个人都忙于版本和需求。公司表面上更高效,真正的新东西却越来越少。

给一半自由时间,相当于公司持续购买大量技术期权。

多数探索不会成功,少数结果可能改变整个模型架构。研究工作的回报分布本来就极不均匀。要求每个项目都产生稳定产出,最后通常只能得到大量可预期的小改进。

不过,“没有 KPI”并不等于没有评价。

研究组织中仍然存在声誉、同事判断、算力分配、核心项目参与权和管理者信任。正式指标消失后,隐性权力可能变得更重要。谁能获得更多机器,谁的想法容易得到支持,谁进入核心讨论,这些都会影响研究自由。

好的无 KPI 文化,需要极高的透明度和同行信任。否则,它很容易演化成一种难以言说的内部等级:表面上人人自由,实际上只有少数人的兴趣能够获得资源。

随着团队扩大,DeepSeek 不可避免地要把一部分隐性规则说清楚。真正的难点在于,怎样建立责任,又不把探索变成交作业;怎样分配资源,又不让研究员为了算力迎合管理者;怎样评价长期贡献,又不退回论文数、版本数和指标提升。

这将比设计模型架构更难,因为组织没有一套可以直接复现的开源方案。

团队稳定是核心资产,也可能成为新的盲点 ​

梁文锋把团队稳定视为唯一不可退让的核心利益。

资金可以融资,显卡可以购买,公开技术可以学习。一个长期协作的研究团队却很难迅速复制。

成员之间积累了大量文档无法完整记录的知识:哪些路线已经失败,哪些指标容易骗人,谁擅长提出问题,谁能把模糊想法做成系统,哪些异常值得追,哪些结果看起来漂亮却不可靠。

这种隐性知识不属于任何单个人,存在于整个团队的关系中。

核心成员一旦大量离开,公司损失的远不止简历上的人数。共同语言、信任和判断机制会一起消失。

因此,期权、研究自由、使命感和组织文化都服务于同一个目的:让这群人愿意长期留在一起。

但“稳定”也有两种。

  • 能力与文化的连续性。它让团队能够长期积累。

  • 职位和权力的固化。早期成员因为资历占据关键位置,新人难以进入核心决策,组织为了避免人才流失不敢调整责任。久而久之,稳定会变成保守。

研究公司不能频繁动荡,也不能把早期阵容永久冻结。

真正值得守住的,是判断标准、合作信任和研究文化;具体的组织分工必须允许变化。否则,所谓团队稳定可能成为拒绝更新的理由。

这里还有一个更深的风险:创始人依赖。

整场讲话强调公司依靠共识,重大决定并非一人强推。但什么是 AGI 主线、哪些方向属于组件、合理利润应该是多少、什么机会算芝麻,仍然主要由创始人的判断赋予意义。

早期团队可以通过长期相处理解这些判断。公司扩大之后,创始人不可能亲自解释每一个决定。

一家真正成熟的愿景驱动公司,需要让核心原则脱离创始人的个人魅力,变成可以被继承、质疑和修正的公共机制。

否则,组织看似由愿景驱动,实际上仍然围绕某个人的品味运转。

商业化在这里更像研究机器产生的余热 ​

DeepSeek 对商业化的态度,可以用一个比喻来理解:研究是发动机,产品和收入像发动机运转时产生的热。

这部分热当然可以被利用,甚至可以为整个系统供能,但公司不准备为了多取一点热,重新设计发动机。

聊天产品、API 和企业收入,都来自通往 AGI 过程中已经获得的能力。模型既然做出来了,向外提供服务可以产生现金流,也可以获得真实反馈。公司无须为每个市场重新建立一整套技术路线。

这种模式有明显的资本效率。

它不需要庞大的销售团队,也不急于进入每个垂直行业。通用模型一旦足够强,许多需求会主动找上门。收入能够覆盖研发之后,公司便拥有更长的技术时间。

梁文锋还给出了一个很现实的底线:即使后续技术长期没有重大突破,只靠 API 服务也可能支撑一家正常公司。

这使 DeepSeek 形成一种不对称结构。

下限是一家拥有用户和 API 收入的模型公司;上限则来自 AGI 突破。

投资人获得了一个具有现实现金流基础的长期技术期权。

但研究与资本之间的冲突并不会自动消失。

资本市场擅长把遥远未来折算成当前估值,也会持续要求增长兑现。技术快速进步时,研究和收入可以同时上升,矛盾暂时被掩盖。真正的考验发生在平台期:研发投入继续增加,模型进步变慢,收入增长也开始放缓。

那时,提高价格、缩减开源、加大销售、压缩自由研究,都会显得非常合理。

一家上市公司天然倾向于把未来压缩进季度,一家前沿研究机构则需要保护那些暂时无法解释的投入。两套时间制度之间存在真正张力。

仅靠创始人个人坚持,很难永久抵抗。

DeepSeek 若真想长期保持克制,需要在治理结构中提前写入一些边界,让投资人从一开始就知道这家公司不会追求全部可得利润。否则,今天被赞赏的理想,很可能在未来被解释成“经营效率不足”。

资本能够接受低利润,通常建立在它相信未来还有更大回报的前提上。当长期回报迟迟不来,耐心会变得昂贵。

国产算力真正的机会,可能藏在编译器和抽象层里 ​

会议关于国产芯片的讨论,有一条比“国产卡性能如何”更值得注意的线索:CUDA 的生态锁定可能被新的编程抽象和 AI 代码生成削弱。

过去,一款芯片是否可用,不能只看理论算力。开发框架、算子库、编译工具、调试系统和工程经验构成了完整生态。即便硬件参数接近,软件不好用,企业也不敢把关键任务迁过去。

英伟达真正强大的地方,长期以来就在这套软硬件共同形成的惯性。

TileLang 一类更高层的编程方式,试图把模型开发者与具体芯片细节隔开。开发者通过较高层的语言描述计算,编译器负责把它适配到不同硬件上。再叠加 AI 辅助写代码,过去需要大量工程师手工迁移的工作,成本可能明显下降。

若这条路线走通,竞争焦点会发生变化。

开发者不必完全复刻 CUDA 生态,也不必要求所有人学习一套全新底层工具。只要上层抽象足够稳定,底层硬件替换会容易很多。

谁控制这个抽象层,谁就拥有重新分配硬件生态权力的机会。

这也是 DeepSeek 参与国产芯片生态的战略意义。它未必需要自己造芯片,却可以参与编译器、算子和模型框架,让基础模型不再深度绑定单一硬件。

不过,软件锁定减弱,不代表硬件问题消失。

芯片制造、先进制程、存储带宽、互联、功耗、良率和产能都需要长期积累。会议中用“四张顶一张”“落后两年”等说法描述国产算力的现实差距,它们共同指向一个判断:国产算力即使能够完成同类任务,也可能付出更多设备、电力和系统复杂度。

生态问题可以通过工程和软件加快解决,制造能力不可能仅靠代码生成跨越。

所以,对国产算力保持乐观可以,不能把“能运行”误认为“完全平替”。真正的平替要同时看性能、价格、功耗、稳定性、集群规模、供货能力和维护成本。

中国 AI 的短期优势更可能来自系统协同:模型架构更节省、编译器更灵活、硬件适配更积极、产品价格更低。单点性能落后时,只能依靠整套系统把差距压缩。

DeepSeek 真正稀缺的,是较低的组织食欲 ​

外界很容易把 DeepSeek 的成功解释为算法天才、工程效率或成本优势。

这份交流却提供了另一个观察角度:公司的优势也许来自一种较低的组织食欲。

它没有强烈冲动去占据每一层价值链,没有立刻把每次技术突破转化成更多产品,没有要求每个员工的时间都被安排,没有把每个用户都视为必须变现的资产,也没有把每个竞争者都看成敌人。

食欲小,组织会更轻。

业务少,协调成本低;部门少,内部政治弱;商业目标有限,研究团队不必不断为销售需求让路;开放程度高,外部合作阻力也小。

这种轻盈本身可以转化成速度。

大公司拥有更多资金和人才,行动却经常缓慢,因为任何变化都会影响现有业务、客户和内部部门。创业公司没有历史包袱,却经常因资源太少而无力承担前沿研究。

梁文锋把 DeepSeek 所处规模称为一个“甜点位”:比小团队更有力量,比巨头更容易组织。

这个窗口不会永久存在。

公司获得更多融资、用户和行业地位后,食欲会自然增长。新员工未必共享早期成员的价值观,投资人会有回报要求,合作伙伴会提出更多需求,政府和社会也会赋予它更多责任。

克制在弱小时是一种选择,在强大之后才是一种能力。

一个没有能力垄断市场的公司说自己不追求垄断,成本很低。等它真正拥有了定价权、流量和技术优势,是否仍然愿意限制自己,那时才能看出“克制”究竟是长期原则,还是特定阶段最合适的战略。

这套逻辑最有力量的地方 ​

这场交流最打动人的部分,并不在于它给出了多么完整的 AGI 答案。

事实上,关于持续学习何时突破、技术方案是什么,梁文锋也明确承认尚未做通。关于产品路线、垂直 Agent 和长期商业模式,他同样保留了许多不确定性。

真正有力量的是,公司内部似乎存在一套相对统一的判断方法。

面对开源问题,它问的是这样做能否扩大长期合作和研发机会。

面对定价问题,它关心收入能否支持持续投入,同时让技术被充分使用。

面对产品机会,它会判断这件事对智能主线究竟有多大贡献。

面对组织管理,它更重视研究环境和人才稳定,而非短期人效数字。

面对算力不足,它没有用情绪掩盖差距,也没有把算法效率神化为万能替代。

许多企业的问题,来自每个部门都按照自己的目标优化:产品追求用户,销售追求收入,研究追求论文,财务追求利润,管理层追求估值。每个人都很努力,整体却缺少方向。

DeepSeek 试图用一个更高层目标,把这些局部目标压在同一条轴线上。

这种自洽本身非常稀缺。

几个疑问 ​

自洽不等于正确。一个体系内部逻辑严密,也可能建立在错误判断之上。

我首先怀疑的是,持续学习是否真的构成通往 AGI 最关键、最靠前的瓶颈。

它显然重要,却未必足够。长期规划、因果理解、价值形成、环境交互、具身经验、可靠自我纠错,都可能同样关键。把具身放到自我迭代之后,是一条节省人力的工程路线,也可能低估了行动和物理反馈对智能形成的作用。

人类并非先发展出完整语言智能,最后才进入现实世界。我们的认知从一开始就与感知、动作和身体经验纠缠在一起。

第二个疑问来自产品。

把 C 端和 B 端视为研究副产品,有助于防止商业绑架技术。但真实用户也是理解智能缺陷的重要来源。很多问题在实验室评测中看不见,只有进入真实组织、承担长期任务、面对模糊需求后才会暴露。

若公司长期把产品视为较低层次的事情,可能失去重要的现实反馈。

第三个疑问是愿景的可扩展性。

几十人可以靠共同信念协作,几千人很难。组织越大,越需要处理利益、晋升、责任、资源和权力。愿景无法消除这些问题,只能影响解决问题的方式。

第四个疑问是开源与安全。

模型能力不断提高后,完全开放可能产生越来越复杂的外部风险。届时,公司如何在开放原则与社会责任之间选择,会比今天困难得多。

第五个疑问来自权力。

克制最终要靠谁来定义?什么叫合理利润,什么叫主线,什么叫不该拿的利益?如果这些边界主要依赖创始人的个人判断,公司仍然缺少一套可持续的自我约束机制。

一家真正低占有欲的公司,需要在创始人离开之后仍然低占有欲。

它想证明,最大的野心可以和有限的胃口共存 ​

这份交流真正提出的,是一种颇为少见的公司形态。

它有很大的技术野心,却不急于扩大商业疆域;它需要资本,又希望资本接受有限回报原则;它追求世界级能力,同时愿意把阶段性成果交给全社会;它相信组织可以靠愿景凝聚,又开始意识到规模扩大后必须建立结构;它重视效率,也承认效率无法完全替代资源。

我愿意把这种形态称为 “低占有欲的研究公司”。

它希望创造很大的东西,却不要求把这个东西带来的每一份利益都据为己有。

这样的公司能否长期存在,目前没有答案。

商业史上,很多理想都在企业变大后发生了变化。早期的开放变成封闭,早期的普惠变成收费,早期的使命变成增长叙事。未必因为创始人虚伪,更多时候是组织越来越庞大,利益越来越复杂,原来的选择已无法满足所有参与者。

DeepSeek 未来最大的考验,也不会只发生在模型排行榜上。

真正的考验会出现在它拥有更多算力、更强模型、更高收入和更大影响力之后。那时,公司面对的诱惑会比今天强得多:提高价格可以多赚很多钱,保留闭源版本可以扩大优势,控制应用可以获得更多用户,进入芯片可以掌握更多产业权力。

它是否仍能记得,最初为什么要克制?

一家弱小公司愿意分享,并不罕见;一家有能力独占的公司仍愿意分享,才真正改变商业常识。

所以,我读完这场交流后,最关心的已经不是 DeepSeek 下一版模型会提升多少,也不是它能否在某个榜单超过谁。

我更想知道的是:当一家公司的能力不断增长,它有没有可能让自己的欲望增长得更慢?

这才是梁文锋提出的最大命题。

AGI 是否能够实现,是技术问题。

一家接近 AGI 的公司,能否不被自己的力量改造,则是更困难的人性和制度问题。

Cherry Chu · Projects, notes, and working documentation.