丹药卖成白菜,前沿实验室就无缘元婴?
判断|成熟能力可以趋同,企业的生产修为与经营位置仍须分别证明。通用元婴的机会尚在,并不意味着所有实验室都能成婴。
AI模型江湖01 / 专题研究 · 产业与投资
谁说前沿实验室成不了元婴?
# 丹药卖成白菜,前沿实验室就无缘元婴?
普通人的红利:产业 × 投资 × 交易,寻找AI时代的Google、Amazon | 于AI诸相中,普皆共证菩提
本系列纯属个人兴趣,仅为AI江湖的八卦交流,不构成任何投资建议!如有侵权,联系删稿!|2026年10月
<strong>问题|</strong>模型降价、能力扩散、大厂追赶,能否直接推出前沿实验室只能做白牌供给?
<strong>判断|</strong>成熟能力可以趋同,企业的生产修为与经营位置仍须分别证明。通用元婴的机会尚在,并不意味着所有实验室都能成婴。
<strong>看什么|</strong>同条件任务差异、合格交付成本、客户持续建设的归属,以及跨代能留下的积累。
第1章 元婴尚未炼成,怎么先判了成婴无望?
前沿实验室究竟还有没有机会长成这个时代的大公司?《AI模型:金丹可争雄,谁能化元婴?》一直追问的,就是这件事。我们已经讨论过公司处在什么位置、智能如何生产、收入与利润往哪里去。如今需要正面拆开一道判词:模型越来越便宜,巨头又都追得上,独立实验室的元婴前程,是不是已经断了?
这道判词有吸引力。模型发布时声势浩大,过一段时间,类似能力出现在更多产品里;客户比较报价、要求折扣,云平台也能接入多家供给。于是,一条推论顺势成立:能力趋同,所以容易替换;容易替换,所以只能降价;只能降价,所以利润留不住;利润留不住,所以成不了元婴。
问题在于,这条链上的每一步,都有尚未证明的条件。某项能力出现替代者,不等于整套生产体系已经复制。报价下降,不等于合格交付的成本降得更慢。客户能换一个接口,不等于下一代产品的建设也能原样搬走。把这些差别略去,结论当然干脆,研究却停在了最需要展开的地方。
我的判断是:部分成熟能力走向商品化,完全可能;据此把所有前沿实验室判为白牌供应商,证据不够。金印五阶判断的是企业已经形成的经营位置。估值高低会改变市场的出价,不能代替金丹的占据与固化,更不能代替元婴的规则地位和合理收益。
因此,这组文章要重新打开进阶的可能性,同时把进阶条件写严。先破商品化的心魔,再问供丹、立派、入世怎样取舍;自营要哪些真功夫,领先怎样跨代留下,亲自进入下游又会变成什么生意,最后都要交给金印五阶检验。活下来、做成一门行业生意、长成通用平台大厂,是需要分别证明的结果。
第2章 功法传开了,修为就都一样了?
说一部功法已经传遍江湖,首先得说明:究竟是哪一招,在什么任务、质量要求和时期里,已经人人会用?
斯坦福《AI Index 2025》给出一个清楚的历史切面:达到GPT-3.5所对应的MMLU门槛,API价格从2022年11月每百万token约20美元,降至2024年10月约0.07美元,输入、输出按3∶1加权。同一章节也指出,当时前沿模型通常仍比同公司的较小模型昂贵。[1] 这说明固定门槛可以迅速便宜,能力前沿的价格差也可以同时存在。
这里必须守住口径。API报价是客户支付的价格,不能直接当成模型厂商的生产成本。达到同一考试门槛,也没有证明复杂任务、多轮工具调用与持续交付已经等价。我们真正关心的,是客户要求的那件事,能否在同样条件下完成。
例如,两个模型都能生成一份看起来像样的报告。但一个能稳定核对来源、处理缺失信息,并在限定时间内交付;另一个需要反复追问和人工补救。只比较第一屏文字,二者接近;比较整个任务,时间、质量和成本可能仍有差别。沿用EDP中工程化D的TQC,就足以表达这种差异,无须再造一套指标。
2024年的τ-bench研究,便把模拟业务里的多轮交互、工具调用与规则执行放在一起验收,还专门考察同一任务多次执行是否都能成功。[2] 这里借用的是评价方法,不能拿当年的成绩冒充今天的能力。它提示我们:答对一次和稳定交付,是两个需要分别检查的事实。
再向里看一层,同样的任务效果也可能来自不同的消耗。Anthropic在2024年11月披露,自己的工程师编写Trainium低层内核,参与AWS Neuron软件栈,并与芯片设计团队协作。[3] 这是一项具体的生产建设动作;最终效率和经营收益仍需另证,却不能把它简化成原厂只会交出模型、等待被复制。
有人用更多资源把结果堆出来,有人把系统经验留给下一版。功法的外显效果接近,仍须继续观察门派的修为。
<strong>表1 从能力趋同推到元婴无望,中间缺哪些证明?</strong>
| 推论的一步 | 至少还要证明什么 |
|---|---|
| 能力接近 → 容易替换 | 相关任务、验收质量与持续可靠性可比,实际迁移代价低。 |
| 容易替换 → 只能压价 | 供给充足,客户不能从更好的交付与新任务中获得额外价值。 |
| 价格下降 → 利润流失 | 同范围成本未能同步改善,新增付费需求也未补足收益。 |
| 利润承压 → 元婴无望 | 跨代生产、客户投入与经营实权长期积累不起来。 |
表中列的是需要检验的条件;单项现象不能替企业直接判境界。
第3章 价格降了,金丹的位置就一定松了?
白菜价最容易让人产生一种错觉:卖得便宜,地位就一定低。可企业的位置,取决于它与客户建立了什么关系,以及这段关系能不能持续。
至少有几种不同的降价。生产效率提高,把一部分节省让给客户;利用率提升,把固定投入摊到更多合格产出上;竞争者涌入,迫使原厂交出过去的溢价;还有一种,是靠外部资金补贴价格。报价单上都写着打折,背后的修行却完全不同。
不妨设一个纯粹用于说明的情景。某类任务以前采购费用太高,客户只在少数关键环节使用。如果技术和工程进步降低了合格交付成本,价格也随之下降,原本不值得做的日常任务就可能进入采购范围。客户开始重写流程、配置权限、建立验收标准,原厂获得的便不只是更多调用,还有下一轮共同建设的机会。
这条路径能够成立,有两个前提。客户因使用而得到的价值,确实超过它支付的全套费用;原厂增加的收入,也足以覆盖承诺的交付、维护和继续投入。两边各有一本账,不能用客户节省了多少钱,替模型公司证明赚到了多少钱。原系列已经讨论过完整成本,这里要追问的是:账算得通以后,新增建设会落到谁身上?
倘若降价来自生产进步,新增任务又能复用同一底座,价格下降可能扩大优势者的有效规模。更多同类需求,让专门的工程优化值得投入;优化进一步改善交付,客户也更愿意把下一项重要任务交来。这里存在积累的可能,不能预先排除。
这里还有一种值得警惕的分化:某类丹药越来越便宜,能够长期供给它的门派反而可能减少。效率更高者承受得住新价格,缺少规模和工程积累者逐渐退出,份额与后续投入便可能向前者集中。这是一种竞争机制,尚不能替哪家公司下结论;但它已经说明,产品便宜与企业变强可以同时发生。
相反,若每接一单都需要新增大量人力补救,低价只是把尚未计入的维护责任推向未来,规模越大,负担也可能越重。若补贴停止,客户立刻回到最低报价的供给方,那么热闹的调用量并未炼出金丹。
所以,我们不能把降价一律解释为衰败,也不能把降价一律包装成飞轮。要看同质量交付的成本是否改善,新增需求是否付款,以及客户后续的产品与生产投入,是否持续落在这家企业的底座上。
第4章 这一招够用了,下一重难关也过得去?
商品化推论还有一个隐含前提:人们要解决的问题大致固定,只要现有模型都达到够用水平,往后的竞争就主要剩下价格。这个前提对于一部分成熟任务可能成立,但不能直接覆盖AI的全部前途。
在能力不足时,很多需求根本不会以采购订单的形式出现。一项研究如果需要人工筛选过多方案,客户可能直接放弃;一个设计过程如果试错成本过高,团队就只探索少数熟悉路径。能力进步的价值,有时在于让以前无法组织的研究和生产开始值得做,而不仅是把旧任务再快一点完成。
Google DeepMind于2025年6月发表的AlphaEvolve论文,提供了一个具体例子:系统让模型修改程序,由评估器反馈,再迭代筛选;作者报告了数据中心调度、硬件电路和模型训练等方面的应用。[4] 这项工作有明确的程序空间与评价条件,不能据此断言全面、无限的递归自我改进已经实现。
但它足以提醒我们,下一重难关可以是生产体系内部的新问题。模型开始参与改进算法,改进又可能降低后续工作的成本。要判断这种能力的产业价值,应追踪被验证的改进能否进入实际生产、能否反复使用,而不是只问聊天体验是否已经相差无几。
由此看,模型能力仍然是关键。工程再方便,无法完成的新任务依然无法完成;接口再统一,也不能把不存在的推理能力变出来。前沿实验室若能持续打开有价值的任务边界,就有机会取得新的议价空间,并争取围绕新能力展开建设的客户。
这件事不必等到AI成为“硅基生命”。任务可以由人提出,也可以由获得授权的Agent发起;它们最终仍要面对成果是否有效、资源由谁提供、责任由谁承担、费用由谁支付的问题。研究探索和经济兑现之间,还隔着验证与交付。取消这些条件,只会把企业研究换成一个无法检验的远景。
同样要承认,开辟新任务并不是独立实验室的专利。上述案例本身就来自Google。老巨头也有研究能力、生产现场和反馈机会。因此,新边界持续推进,只证明竞争尚未结束,并没有替任何一方预定胜局。谁先解开难题,又能把解法留在自己的生产体系里,谁才有下一步可争。
第5章 同样调用一部功法,为什么有人能立金丹?
江湖里人人都能借到一部功法,谁在组织练功,谁在承担结果,仍然可能不同。放到企业里,这个问题就是:客户的重要建设,究竟围绕哪一家展开?
AWS在2024年12月介绍Bedrock智能提示路由预览时,允许同一模型家族的大小模型按任务复杂度分流,并保留强模型处理更难请求。[5] 这项功能说明,模型之上还可能有一层系统,负责判断用什么能力、怎样平衡质量与成本。这里的公告并未证明所有厂商都可无差别互换,但它展示了请求分配权可以由平台掌握。
设想同一家客户购买同样的模型能力。若流程编排、评测资产、权限管理和合同关系都留在云或客户自有系统中,Lab只提供一个可替换的推理接口,那么客户越依赖AI,未必越依赖这家Lab。平台可以积累客户建设,模型原厂则继续参与供给竞价。
另一种可能是,客户把重要产品的开发、验证与持续运行建立在原厂能够主导的共享底座上。下一项产品继续复用已有组件、交付体系和联合验证经验;原厂也持续承担升级与服务责任。此时,模型只是入口,金丹的“占据”开始有了经营内容。
但是,共同建设仍须辨清归属。客户自己训练的团队、自己控制的数据、可以跨供应商使用的评测集,并不会因为项目中调用过某个模型,就自动成为原厂的家底。合作的价值可能同时留在双方,也可能主要强化客户自己的平台。对哪一家授金印,必须沿着真实关系来判断。
<strong>表2 功法扩散之后,哪些积累可能留下?</strong>
| 正在扩散的东西 | 仍需单独检查的积累 | 金印判断的落点 |
|---|---|---|
| 一项任务的模型效果 | 同等质量的持续生产、交付与故障处理 | 交付改善是否促成围绕底座的重要、持续建设 |
| 接口与调用方法 | 评测、权限、工具和流程由谁组织 | 重要建设围绕谁的底座展开 |
| 某一代的技术方法 | 下一代能否复用工程、数据与经验 | 原有占据能否在下一轮继续固化 |
| 低价获得的使用量 | 客户付款、伙伴投入与收益归属 | 是否进一步形成规则与合理收益 |
这是观察位置的对照,不是新增评分表;资产归属以实际安排为准。
也正因此,金丹与元婴不能混着说。客户围绕某个底座投入,给了我们检查占据与固化的理由;要继续谈元婴,还得看到规则、分配或定价上的实际影响,以及两高两稳所要求的经营结果。技术领先很重要,却不能凭一纸榜单包办这些证明。
这给独立实验室留下的机会很具体:在能力前沿打开任务,在生产上稳定兑现,在客户下一轮建设中持续成为中心。给巨头留下的优势也很具体:如果客户资产与分配权一直留在原有平台,它就有条件把外部模型变成供应来源。到底是哪一种,需要逐家、逐项业务追踪。
第6章 哪些实验室,可能始终只是可替换的供给?
既然反对提前判死,就必须讲清楚:什么事实出现以后,白牌化的判断应该被接受?否则,任何失败都能被解释成修炼未到火候,这套研究也就失去了约束。
如果某项业务长期停留在成熟任务上,多家模型在客户认可的质量范围内都能完成工作,切换只需很小代价,供应也足够充足,那么供给方确实可能长期受制于价格。原厂即使技术不错,也未必掌握这项业务的经营主动权。
更强的证据,是跨过一轮更新后,先行者什么都没有留下。竞争者追平了效果,客户随即迁走;原有交付和评测并未转化为下一代效率,客户新产品也不再围绕它建设。过去的领先只卖出了一个时间窗口,没有沉淀成持续的位置。这时,担心利润留不住,就有了实质依据。
还有一种情形:实验室始终需要渠道替它组织客户,渠道掌握验收、路由和续约;实验室承担研发与供给风险,却只能竞争订单。若其能力仍稀缺,供货也可能获得好收益;若稀缺性消失、客户建设又都留在平台,原厂的处境才会更接近白牌。供货说明交易关系,白牌化说明可替换性与议价处境,两者不能直接画等号。
这些条件同样约束大厂的新模型业务。母公司的客户很多,并不能证明某个模型产品已形成不可忽略的地位;集团能够补贴,也不能证明这项业务具有长期回报。江湖出身不能代替经营证据,独立实验室与老巨头应当接受同一把尺。
承认有人会止步,并不削弱本篇的反驳。我们要破掉的,是从局部价格现象直接跳到全行业命运的结论。证据显示哪项供给已经高度可替换,就在那个范围内承认;证据显示哪家企业仍在积累,就继续研究它的进阶条件。两件事可以同时成立。
第7章 谁说元婴无望?先看供丹、立派、入世怎么选
回到开篇:丹药卖成白菜,前沿实验室就无缘元婴吗?我的回答是,不能这样判。商品化描述了一组真实的竞争压力,它没有自动证明生产积累失效、客户建设可以随时迁走,更没有证明新时代的规则与利润必定归老巨头所有。
前沿实验室仍有可争的路。成熟任务的成本下降,可能让更多生产开始值得开展;更强模型打开新任务,可能让客户开始新的投入;持续的工程与共同建设,可能把一次采购推进到金丹的占据与固化。每一个“可能”,都要由具体企业把它做出来。
接下来的观察,应该放在变化上:同一任务、同一质量要求下,有效供给是否继续分化?客户的新产品、新流程、新预算,正在围绕谁展开?上一代积累到了下一代还起不起作用?这些证据比一句“都是白牌”,更接近我们要找的答案。
不过,保留机会还不够。实验室的资源有限,必须决定主要经营什么:把模型供给别人的平台,自营一个通用智能山门,还是亲自进入行业经营产品与成果?供丹、立派、入世可以组合,低成本则贯穿三者。真正的选择,是把粮草投向哪一种客户关系,并为此承担哪些生产和经营责任。
下一篇就把判词放下,把修行写实:<strong>《供丹、立派、入世,冲关元婴该走哪条路?》</strong>。元婴席位尚未封榜,能否争到,得看门派接下来怎样用自己的粮草与功夫;换了一门生意能否成功,也要按新的经营范围重新判断。
资料来源
[1] Stanford HAI|The 2025 AI Index Report, Chapter 1: Research and Development(2025-04-07)。第41—42页,固定MMLU门槛的API价格及前沿模型定价差异;属于历史价格口径。 <https://hai.stanford.edu/assets/files/hai_ai-index-report-2025_chapter1_final.pdf>
[2] Shunyu Yao等/arXiv|τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains(2024-06-17,v1)。摘要及基准设计、重复执行可靠性部分;本文引用评价方法,不以历史分数代表当前水平。 <https://arxiv.org/html/2406.12045v1>
[3] Anthropic|Powering the next generation of AI development with AWS(2024-11-22)。Collaboration on AWS Trainium hardware and software;公司披露的工程职责,不直接证明整体成本或经营回报。 <https://www.anthropic.com/news/anthropic-amazon-trainium>
[4] Alexander Novikov等/Google DeepMind|AlphaEvolve: A coding agent for scientific and algorithmic discovery(2025-06-16)。摘要及计算基础设施应用;结果为作者报告,范围受程序空间与评估器约束。 <https://arxiv.org/abs/2506.13131>
[5] AWS News Blog/Danilo Poccia|Reduce costs and latency with Amazon Bedrock Intelligent Prompt Routing and prompt caching (preview)(2024-12-04)。Intelligent Prompt Routing与fallback说明;当次预览公告描述同一模型家族内的路由。 <https://aws.amazon.com/blogs/aws/reduce-costs-and-latency-with-amazon-bedrock-intelligent-prompt-routing-and-prompt-caching-preview/>