文章AI模型江湖 · 第 16

十三家同尺:谁在修工厂,谁在让客户修山门?

不是相加评分排盟主:比较生产条件、交付分工和最近关口,辨认客户的下一笔投入流向。

徐瀚勃2026-09-21

AI模型江湖16 / 横向收束 · 十三家同尺

普通人的红利:产业 × 投资 × 交易,寻找AI时代的Google、Amazon | 于AI诸相中,普皆共证菩提

本系列纯属个人兴趣,仅为AI江湖的八卦交流,不构成任何投资建议!如有侵权,联系删稿!|2026年9月

这一篇,先看三本账

产业的账:十三家有不同需求、供给与交付路径。把CADEF和实际工作放在一起,辨认各自可能打开哪一门生意,而不是先按国籍与出身排座次。

投资的账:OpenAI、Anthropic为金丹初期、向中期验证,其余仍在筑基不同位置;客户为什么持续投入,决定能力怎样变成实权。

共修的账:比较表不是买入名单。先明确各家的最近一道关,再用新证据校准阶段和风险,不让价格与愿景替经营关系答题。

一|江湖合卷:一桌高手,为什么还不是一桌金丹?

十三家宗门看完,最省事的结局,是把分数相加,按小数点排座次,再给第一名披上“未来盟主”的斗篷。戏是收得很快,客户却还没出场。我们真正要找的,是能够把智能组织成新生产、再把生产做成长期生意的公司。谁的炉火最旺,与谁身边开始有人盖工坊,是两道相连却不同的题。

先把26Q3的研究位置摊开。这里看各家的模型与新AI业务,不是给集团历史功劳重新排榜;“待证”表示相应关系的证据尚未充分取得,不是断言现实中没有。⁠[1]⁠这张地图的用处,是让读者知道每家接下来该过哪一关,而不是宣布谁的未来已经写在生辰八字里。

当前研究位置公司最近一道关
金丹初期,向中期验证OpenAI、Anthropic局部客户投入,能否跨客户、续约和版本持续扩散
筑基后期,冲击金丹未突破智谱、DeepSeek市场选择能否变为持续、可归属的生态投入
筑基后期,金丹待证Gemini、Grok、Meta新模型/新工作体系的外部投入与迁移证据
筑基中期Kimi、MiniMax供给、可靠结果成本与同批客户续用先站稳
筑基中期,向后期验证阿里、腾讯、字节新AI自身的外部采用,不借集团旧业务通关
筑基初期阶跃星辰固定场景做对、正式上线、实际活跃与付费

Google的工程资源、智谱的国产推理整合、DeepSeek的算法与系统积累,各自为生产智能提供底气。产业上,强供给让更多任务有机会被接住;投资上,还要看客户是否持续围绕它投入,而且过去的资产能影响下一次选择。能出招让你上桌,别人愿意继续与你建设,才开始让这张桌子成为你的江湖。

Anthropic披露的Rakuten案例描述了客户改造开发流程,比买一批账号更接近生态投入;OpenAI的执行工具则提供持续建设的条件。⁠[2]⁠⁠[3]⁠两者各有分量,也各有边界:一例客户不能代表全体,产品功能不能代填迁移成本。两家列在金丹初期,是承认关系已经有具体线索,并继续检查它能否扩散和延续。

这也要求比较者留一份耐心。私营公司的账本不一定齐,厂商案例又往往挑好看的讲。没有财报不等于没有收入,故事多也不等于依赖深。真正的区分度,应来自供给、客户和收益之间的关系,而不是谁的公关团队把资料袋装得更厚。

二|产业视角·需求:同叫AI,客户要的并非同一味丹

先让客户入席。有人要更经济地处理大量任务,有人要把复杂代码改对,有人需要长资料连起来理解,有人要合格视频,还有人要跨系统交付。这些需求共同指向一件事:过去得凑齐专业团队的工作,能不能变成可获得的服务?若只盯一张通用榜单,便会把不同产业的生意硬装进同一张考卷。

智谱、DeepSeek的机会,是让模型能力进入更多实际工作,接着看关系怎样沉淀;Kimi要把长任务做得好,也接得稳;MiniMax要让不同模态减少客户反复整合的负担。阶跃走端云路线,则先从签约、上线、活跃和实付之间查真实需求。⁠[1]⁠这些是各自当前的经营题,不是替它们永久圈定地盘。

大厂组的变化也各有方向:腾讯可以组织多模型工作,字节要分清内容满意与工作验收,Google、阿里要把云条件接成新供给,Meta要让新体系承接有效旧投入。⁠[1]⁠老家底可能减少客户第一次入场的难度,却仍要靠新价值赢下第二次选择。江湖大,不必全卖同一把剑;但每家都要说明,客户买它究竟为了什么。

增能让人做得起,承责让一段工作能够持续托付。前者看能力是否可获得,后者追谁执行、谁恢复、谁验收,客户还要做多少协调。代码能运行、成片被接受、跨系统业务按约定完成,都可能是深任务的结果。不能给“办公”穿件朴素衣服,就说它没有技术含量;客户的麻烦从来不按职业名称排等级。

丰裕进一步看可靠结果能否更普遍、更可负担;破界看新方法怎样进入真实使用;创生看新能力能否支持下一轮创造。AlphaEvolve已有算法进入Google生产工程的披露,为局部转化提供了例子。⁠[4]⁠这是产业价值的展开,不是Gemini已经取得外部客户收益权。五个价值阶段看天地,金印五阶看企业占住了什么位置。

需求还可能由运行中的Agent发起:为一个结果再找验证,为一段工作请求工具。它打开的想象,是更多此前没人顾得上的任务可以持续发生;但中间调用仍须落到可用成果。比较十三家,不是统计谁的剑气最多,而是看谁让原本难办的事开始值得做、做得成。

三|产业视角·供给:同看CADEF,不只比谁炉子多

把需求放在心里,再看供给。CADEF以C算力工程30%、A算法效率25%、D数据工厂20%、E经验飞轮15%、F资本续航10%作研究比较。下面65项分数用于辨认长板与证据缺口,不合成胜者榜;尤其A、D的完整工艺没有同口径披露,半分不能冒充同预算实验测出的差距。⁠[1]⁠

公司C 30%A 25%D 20%E 15%F 10%
智谱8.58.57.56.57.5
DeepSeek8.09.07.55.07.5
月之暗面/Kimi7.08.57.55.06.5
MiniMax6.57.57.05.06.5
阶跃星辰6.56.56.04.55.5
阿里/千问8.58.07.06.08.5
腾讯/混元8.08.06.55.58.5
字节/Seed·豆包8.58.07.06.08.5
OpenAI9.59.58.58.59.0
Anthropic9.09.58.58.59.0
Google/Gemini9.59.08.57.09.5
xAI/Grok8.58.57.05.08.0
Meta9.09.07.55.59.0

C最容易被一个大数字带走。智谱披露超过十万颗国产芯片的大规模推理与网络、引擎整合;Fire-Flyer 2论文中的万卡系统,则是2024年的历史软硬协同证据。⁠[5]⁠⁠[6]⁠前者不等于十万卡统一同步训练,后者也不等于DeepSeek今天只有一万张卡。它们共同值得看的,是团队把资源组织成实际运行的能力,而不只是仓库里摆了多少箱子。

Kimi公开通信、注意力算子和环境工具,Meta也披露过自建集群。⁠[7]⁠⁠[8]⁠这些行动让“系统工程”有了具体内容:少等一次通信、少搬一轮数据、失败能继续运行,才可能让客户得到更稳定的服务。但Kimi特定H20测试的1.72—2.22倍,仍只是指定算子对照。自建、共建都要看设计与控制;局部快,不等于全厂一起快。

A问“架训配评迭”怎样让能力改善,D问学习信号怎样持续产生,E问真实工作能否返回教训。OpenAI的3.1个Agent工作日,是特定研究组织的工作时长比;Anthropic约40万次会话,是特定时期的观察样本。⁠[9]⁠⁠[10]⁠它们提示智能已经参与实际工作,却不能相除得到飞轮转速。内部训练环境、真实过程和获准改进,各有一道接缝。

F则决定下一轮还能否投入、能承受怎样的失败。到账与承诺、期末现金与累计融资、债务与股本、集团资源与模型预算,都要分开。资本可以买继续试错的时间,却不能代替那次试错的成果。反过来,暂时缺少公开数据,也不能把实际能力填成零;灵石多少要看账,不能靠猜宗门穷富。

读这张表,更有用的是找配合关系:工程能否支持算法运行,数据能否提供验证,真实问题能否回来,资金能否维持下一轮。Google、Meta高C/F而金丹待证,说明强工厂与客户关系可以不同步;智谱C较高、E仍有缺口,也提醒我们服务规模不是经验全量。五项分数描出生产条件,客户下一轮建设才检验这些条件留在哪里。

四|产业视角·交付:换一层服务,谁的价值留下?

能力怎样进到客户手里,决定了关系可能长在哪一层。模型提供推理,工作平台组织执行,云与客户环境保存资料、身份和运行条件;同一家公司可以兼任几项,也可以与别人分工。我们不设“包办全部才算赢”的规则,而用三次有方向的替换,把每一层实际创造的价值找出来。

检验方式重点研究对象需要核验的资产与代价
换模型,保留工作环境智谱、DeepSeek、Kimi、MiniMax等模型供给;也适用于大厂自研模型专属评测、适配和同质量成本;数据与工具能否继续复用
换工作平台,保留可用模型OpenAI、Claude、腾讯工作层,以及其他新工作产品状态、工具编排、恢复与上线流程;哪些属于客户自己
换云/旧环境,保留模型与AgentGoogle、阿里等云交付路径;设备侧还需看OEM分工身份、资料、运行合同与重验证;不能全部算成模型壁垒

先换模型,保留工作环境。智谱、DeepSeek、Kimi、MiniMax,以及大厂自研模型,都可以面对这道题:同一任务交给另一模型后,质量、验证与完整成本怎样变化?标准接口能接通,是好事,却不表示业务效果相同。若持续维护和专属适配使原供给更值得用,便可能形成关系;若大部分有效资产都在客户通用层,就应把功劳留给客户。

再换工作平台,保留可用模型。OpenAI的SDK支持客户接入自有沙箱,并把执行状态与计算环境分离,官方还描述了恢复机制。⁠[3]⁠它提供的不是把所有资料都搬进同一间房,而是让执行、状态与环境更容易协作。拿走这层后,客户要重建多少运行与支持?平台的价值可以来自少搭一套底座,而非多锁一把钥匙。

腾讯、字节因此值得两头看:一个工作平台越能组织不同模型,越可能替客户减少选择和运行负担;底层自研模型却仍须证明自己的增量。对平台是更大的服务范围,对模型可能是更直接的竞争。这是交付结构所提示的可能,不是已经量出的换模成本。不能一句“生态强”,把平台的成绩和模型的成绩抄成双份。

最后换云或旧环境。Google的Model Garden支持多种模型,让发现与运行更方便;云上采用却不能全记给Gemini。⁠[11]⁠阿里同样要区分云关系与自研模型选择。设备侧还要追阶跃与OEM的分工:谁管账户与权限,谁维护接口,谁影响下一轮升级?旧资产若能成为机器工作的可靠条件,可以继续有价值,但归属必须沿实际路径看。

三次检验最终都回到一个正面问题:谁让客户已经做过的功课,在下一次工作里继续有用?一次适配很贵,可能只是填坑;版本更新后旧评测仍能复用、异常处理更省事,才像持续积累。金丹不是把搬家路挖坏,而是客户算过账之后,仍愿意留下来扩建。这要有客户记录,不靠供应商自己朗诵门规。

五|投资视角:金丹要养厚,元婴要守住哪份实权?

经过需求、供给和交付,才轮到投资视角。筑基说明技术与市场选择有了基础,金丹说明客户开始围绕体系建设;往元婴走,还要让这种关系成为产业组织、协作规则与合理收益。客户懒得换、单季毛利高、一次涨价成功,都只能回答其中一角,不能替整座山门颁发神位。

元婴的五道关十三家放在一起,重点比较什么
重构生产是否支撑客户的新业务与新交付;区分产品功能、样板存在和持续群体结果
影响终端人或Agent是否主动指定其能力;不能用默认入口与内部导流代替选择
穿透分配扣除模型、工具、渠道与服务成本后,原厂、伙伴和客户分别留下什么
取得规则权价格、版本和交付条款改变后,伙伴是否仍能经营、客户是否继续建设
两高两稳兑现新AI的收入与客户质量、毛利、现金和资本回报能否持续支撑实权

同一道元婴之门,各家走到门前的路却不同。OpenAI、Anthropic先看已有投入能否跨客户、换代与续约扩散;智谱、DeepSeek先看采用能否变成可归属的建设。Grok、Gemini、Meta的资源和工具值得重视,但仍需新业务自己的外部投入。⁠[1]⁠近期考题不能跳过,长期方向也不该只剩一个“继续关注”:要看谁正让客户在新体系里做成生意。

再往里看,客户、模型原厂、工作平台与云商完成同一个结果,账单抬头与最终收益不一定一致。开放接口可以扩大市场,也可能加强使用者的选择权;封闭产品可以提供完整服务,也可能增加交付与维护负担。两条路都要证明,客户得到的改进足以支持持续购买,而供应商留下的收入能覆盖相应成本。

规则权的分量,体现在变化之后。换一个版本,客户原有资产还管用;调整服务或分成,伙伴仍愿经营;遇到竞争,原厂仍能维护质量和合理收益。这样的规则才更像元婴的骨架。单次调价后没有立刻流失,可能只是合同尚未到期;真正的实权要在继续合作的选择中逐渐显形。

两高两稳是经济检验:营收与客户质量、毛利、现金和资本回报,需要一起支持新AI的位置。旧广告、旧云利润可以输血,却不代替新业务算账;融资也不能作为客户已为全部成本付款的凭据。到化神,还要有两新两好,让旧能力帮助新产品、新客户少走弯路,并由团队和资本配置把优势继续养大。

因此,未必只有一种公司形态能成长。高效率的智能供给、可靠的工作交付、难以替代的专业平台,都可能占住重要位置。我们寻找的是能够改变产业的公司,不是十三个外观相同的超级App。金丹看谁愿意围绕你建设,元婴看这种建设能否形成持久的规则与收益;商业路径可以不同,尺子不能轮到谁就换。

六|交易视角:同一张比较表,不是一张买入名单

融资估值、历史发行价、收入运行率和季度财报,不是同一时点、同一口径的交易依据。产能分、金印阶段与价格,也不能平均成“最值得买”的分数。⁠[1]⁠认知不足先取证,价格透支保留边界:产业伟大不担保企业获利,企业获利不担保股东回报。找宗门不是抢最后一张船票,别让修仙题材替追高情绪配了乐。

七|共修观察:十三家公司,各等哪一道新证据?

一张有用的比较表,要能带人走向下一次判断,而不是把今天的名次裱起来。阶跃先看正式交付与付费,Kimi和MiniMax先看供给及重复选择,筑基后期补生态投入,金丹初期补覆盖与持续性。下面各列一个最值得追的方向,让十三家的差异落到实际经营,而不是各收一句同样的祝福。

公司下一份最值得等的证据
智谱客户为GLM持续投入的工具/评测/预算,以及换模要重建什么
DeepSeek开放与自部署采用后,长期维护、客户资产和服务关系究竟归谁
Kimi稳定容量、每个可靠结果成本及同批客户跨期续用
MiniMax分模态续用与跨产品资产复用,不只看合计收入和触达
阶跃星辰正式上线、持续活跃、真实付费及固定场景验收结果
阿里/千问留云换模之后,Qwen自身的实际选择与客户投入证据
腾讯/混元换模型与换工作平台两次检验,各自造成什么影响
字节/Seed·豆包外部实付、工作验收与获准反馈,分别归于模型还是工作层
OpenAI专属状态与工具投入,能否跨客户、换代和续约周期持续复用
AnthropicClaude工作投入的群体扩散,以及直客/云分发的关系归属
Google/Gemini云客户中真正指向Gemini的专属资产与替换代价
xAI/Grok企业试用转生产之后的持续付费、模板投入和版本复用
Meta旧生态到新体系的真实迁移、有效资产留存与新增经营投入

这不是给每家企业凑一份漂亮数字,而是说明下一份材料该怎样读。客户或任务范围、时间、成功与失败、费用包含哪些项,缺一都可能读偏。只展示留下来的客户,不问谁离开,是给幸存弟子拍合照;只报增长不交代基数,则是把扩音器当测量仪。证据没有新增,可以维持判断,不必靠反复改分制造热闹。

共修还要分清两种变化:公司真的让更多客户持续投入,经营关系向前走;或者新材料纠正了我们原先不完整的认识,企业并没有在这一天突然升级。研究者承认看错,与企业实际退步,也不是同一件事。尺子用久了要校准,不能因为已经写进文章,就让旧判断从此享受祖师爷待遇。

十三家比较留下的是一条完整的路:产业看新需求、真供给与可靠交付;投资看选择怎样变成投入,再变成规则与收益;交易提醒我们,认出机会不等于不问价格。工厂越强,客户的选择越多;只有持续让下一轮建设更值得的公司,才更可能把能力炼成自己的产业位置。

下一篇,把目光从各家修为移向灵石的去向:智能更便宜,客户更有能力,为什么不是每座炼丹炉都赚钱?天下灵力丰裕,利润究竟会留在哪一段?

资料与研究口径

研究资料至2026年9月。十三家公司阶段与65项CADEF评分为本系列26Q3研究判断,不是实时模型排行榜,也不是统一预算实验。三种替换、阶段推进与元婴比较用于分析经营关系;尚未取得的客户迁移、队列与全成本数据不视为已知。

[1] 本系列研究框架|十三家公司、CADEF与金印五阶

26Q3研究口径。阶段分组、五维评分和下一步观察属于作者判断;模型、新工作平台、云与集团旧业务分层评估,缺证不等于现实中不存在。

[[2] Anthropic/Claude|Rakuten客户案例](https://claude.com/customers/rakuten)

用于说明客户围绕Claude改造开发流程的局部事实。厂商发布的案例具有选择性,不外推全体客户或确定留存。

[[3] OpenAI|The next evolution of the Agents SDK](https://openai.com/index/the-next-evolution-of-the-agents-sdk/)

2026-04-15。客户自有沙箱、可配置记忆及状态恢复等;产品条件不等于实际迁移代价。

[[4] Google DeepMind|AlphaEvolve](https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/)

2025-05-14。新算法进入部分生产工程的局部证据;不等同全社会丰裕、通用自主科研或Gemini收益权。

[[5] 智谱|2026年中期业绩公告](https://www1.hkexnews.hk/listedco/listconews/sehk/2026/0831/2026083101539.pdf)

2026-08-31。PDF第3、10—11页:超过十万颗国产芯片的推理与网络/引擎整合;不将推理规模写为统一同步训练。

[[6] Fire-Flyer AI-HPC|软硬协同技术论文](https://arxiv.org/html/2408.14158v1)

2024年论文,v1。万卡Fire-Flyer 2体系属于历史工程证据,不是DeepSeek现役库存或今天的模型成本。

[[7] Kimi|K3开放权重、技术报告与关键工程组件](https://www.kimi.com/news/kimi-k3-open-source)

2026-07-27。MoonEP、FlashKDA、AgentEnv等;1.72—2.22倍是特定H20算子对照,不能推广到整厂。

[[8] Engineering at Meta|Building Meta’s GenAI Infrastructure](https://engineering.fb.com/2024/03/12/data-center-engineering/building-metas-genai-infrastructure/)

2024-03-12。历史自建集群与运行能力,用于核查工程形态;不是新模型当前专属资源。

[[9] OpenAI|Research acceleration: The view inside OpenAI](https://openai.com/index/research-acceleration-view-inside-openai/)

2026年9月发布;3.1个Agent工作日/人类工作日为截至8月中旬研究组织的工作时长口径,不是产出倍率。

[[10] Anthropic|Agentic coding and persistent returns to expertise](https://www.anthropic.com/research/claude-code-expertise)

2026-06-16;约40万次会话来自2025年10月至2026年4月。特定样本研究不等于客户普查、全部训练授权或回流率。

[[11] Google Cloud|Model Garden产品文档](https://cloud.google.com/vertex-ai/generative-ai/docs/model-garden/explore-models)

Model Garden支持多模型;引用页面跳转至Gemini Enterprise Agent Platform文档。产品功能用于解释云与模型的分工,不作为客户留存的证明。

研究说明:企业事实、研究判断与条件推演分别呈现。资料月份不代表覆盖整月;历史工程数据不作为现役库存,一家公司的案例不替另一家公司举证。本文不构成任何投资建议。

声明:本文由 AI 辅助整理初稿,经作者人工审核、补充实战案例与方法论解释后定稿。核心观点与案例判断为作者原创。