文章AI模型江湖 · 第 13

腾讯:WorkBuddy很热闹,混元的金丹归谁炼?

腾讯组织多模型工作的价值,与混元自身的价值,分别让客户在哪一层持续建设?

徐瀚勃2026-09-21

AI模型江湖13 / 公司研究 · 腾讯/混元

普通人的红利:产业 × 投资 × 交易,寻找AI时代的Google、Amazon | 于AI诸相中,普皆共证菩提

本系列纯属个人兴趣,仅为AI江湖的八卦交流,不构成任何投资建议!如有侵权,联系删稿!|2026年9月

先看结论

当前定位:筑基中期,向后期验证。混元有自研与部署进展,工作产品也有采用;近期要分别看模型选择与平台交付,不能借旧生态提前结丹。

产业视角|AI Native:机会在于把跨资料、跨工具的工作组织成可托付服务,让小团队少搭系统、少做交接,而不是只给办公再添一个聊天框。

投资视角|金印五阶:模型与工作平台可以沿不同路径取得位置。先看混元能否持续被选择,再看客户的技能、评测、状态与预算究竟围绕谁积累。

交易视角|风控五环:集团财力支持探索,新AI业务仍需独立核对成本与回款;不把平台热度直接推成模型利润,也不从修为标签推算买入价。

元婴观察:看新的工作体系能否形成持续交付分工、终端指定与合作规则,让平台、模型和伙伴在完整成本之后都有合理收益。

一|江湖开场:台上都是高手,谁在炼自己的金丹?

看智谱、DeepSeek时,我们追着模型问:功法进了别人的工作工具,客户最后留在哪里?到了腾讯,镜头正好翻过来。WorkBuddy可以组织不同模型替客户办事,平台有机会做成好生意;但门口挂着腾讯的牌匾,不代表台上每一招都出自混元。请得动各派高手,与练成自己的内功,是两种本领。

腾讯2026年二季度业绩公告把多模型供给、执行框架和技能库列为WorkBuddy的优势。所引办公Agent领先指标,是6月中国PC端AI原生办公Agent的月交互次数,不是全球任务成功率。[1]它说明产品吸引了使用,也让我们看到一条产业路径:不一定先让自家模型天下第一,才有资格把工作组织起来。

混元也并非只在后台等分红。七月Hy3正式版进入多个产品,Hy4又披露了技术与部署方案。[2][3]一边做工作产品,一边练模型功法,腾讯在两条线上同时下注。问题不是“借剑算不算本事”,而是哪一部分真正让客户少做协调、愿意续用,并成为下一次建设的基础。

本篇把混元及相关新AI业务定位在筑基中期,向后期验证。集团原有的企业关系与云资源可以帮它起步,却不能替新业务回答这道题:平台越会组织不同模型,混元是在成为更有分量的核心供给,还是其中一位可替换的高手?分清这一点,才知道金丹究竟在谁的炉里炼。

二|产业视角·需求:少一个聊天框,多一段办完的事

“不过是办公”听着轻巧,真遇到跨系统对账就会知道,难的往往不是写一段话。资料散在不同地方,字段含义不一样,异常还要追出处;等人把材料找齐,最紧急的时间已经花在交接上。小团队养不起所有专业角色,能否经济地获得这套能力,才是增能的产业空间。

WorkBuddy的执行框架与技能库之所以值得看,[1]是因为客户缺的不只是一个答案生成器,还缺把资料、工具与步骤组织起来的办法。若这些基础工作能被服务承接,小企业就可能提供以前只值得大团队做的持续核对、维护或分析。入口的重要性,也从“有多少人打开”转向“有多少工作因此开始做得起”。

设想一家小公司核对供应商订单与回执:系统收集材料,标出差异,追到原始依据,再给出待确认的更正方案。这是检验价值的假设场景。AI能写出差异说明是增能;若能保留进度、继续追问缺失项、把异常交给有权处理的人,才开始承担一段完整工作。

承责不是让老板换个地方值夜班。谁能读资料、谁能改系统、付款前由谁确认,仍须明确。工具越多,交接越复杂,客户越需要稳定的执行、恢复和验收。权限边界不是服务的绊脚石,而是客户敢把重要事情放进来的条件。账房可以有新助手,银库不能只凭一句“相信我”开门。

任务也可以从业务事件或上游Agent进入。它发现数据不一致,继续发起核验,最终把有依据的结果交回来;机器参与的价值在于把工作连续做完,不在于互相发了多少条消息。丰裕看合格结果是否更可负担,破界与创生再看新办法、新工具能否成为后续生产条件。办公不必先被宣布革命,少一次无效交接,就可能是一门新服务的起点。

三|产业视角·供给:自家功法,也要和运行一起练

工作平台可以借多家模型出招,自研模型的进步也有独立价值。腾讯的CADEF要看这两条线怎样配合,又在哪些地方仍缺证据。以下五项是26Q3研究档位,不是把用户数量换算成生产能力,更不是给集团资源自动盖一张金丹证。

维度与权重评分/10本篇最重要的判断
C 算力工程 · 30%8.0云运营与自研部署支撑供给;不是混元独占资源的证明
A 算法效率 · 25%8.0自研迭代与技术配方可查;第三方模型成绩不算混元
D 数据工厂 · 20%6.5专家与可执行任务有证据;题库不是客户生产全量
E 经验飞轮 · 15%5.5业务反馈有线索;平台用量、模型负载与授权回流分开
F 资本续航 · 10%8.5集团资金能支撑投入;实际AI预算与付款义务另核

C不是“有腾讯云”四个字。Hy4材料给出低精度部署、预测后续Token的模块,以及推理框架适配方案。[3]它们说明团队正在处理内存、吞吐和实际运行,而不是只把一个模型接口接到产品上。计算资源能被更有效地使用,才有机会让更多客户以可承受成本获得能力;局部部署方案仍不能代替整厂运行数据。

“算存光冷电”看硬件与能源,“编并调容服”看编译、并行、调度、容错和推理服务。复杂任务进来时,缓存、网络、排队和失败怎样一起处理,是工程真正的考场。云运营底盘可以支持混元,却不能用集团采购额补出模型专属集群、训练扩展效率或长期可调度容量。

A的关键,是算力花在了哪里。Hy4披露门控稀疏注意力与索引缓存等设计,尝试减少长上下文中不必要的计算。[3]“架训配评迭”不是五本互不相干的秘籍:结构要能训练,配方要能部署,评测要能找到错误,迭代还得让错误减少。采用公开研究的组合可以有价值,工艺在于能否把它稳定炼出来。

模型卡列有163名内部专家、203个任务的盲评,同时承认某些任务出现推理过长、过度验证。[3]这不是全球客户抽样,也不能推成所有工作都低效;但它提出了很具体的改进题:多想几步究竟增加了可靠性,还是只增加了账单?把结果、人工接管与总成本一起测,才知道是在认真思考,还是反复念咒。

D给练功搭场地,E要把出门办事的教训接回来。WorkBuddy Bench把代码、网页、办公与安全放入可执行任务,并讨论从真实开发、业务材料构造和改写题目以降低污染。[4]这让评测更接近实际工作中的工具与步骤,但题库依然是研究环境,不能直接写成客户生产全量。

D的“人合环验洗”,看材料、合成任务、执行环境、验证与筛选能否产生有效信号。E的“量深轨果回”,再追真实任务的深度、过程、最终结果与获准改进路径。Hy3材料提到实际业务反馈推动迭代,[2]但平台总请求、混元实际执行量、可观察结果与可使用反馈,仍是几个不同分母。

例如,WorkBuddy完成一项任务,底层可能使用其他模型;企业允许处理文件,也不等于允许它进入基础模型训练。最有价值的闭环,是一类真实错误被发现后,怎样进入评测、环境或训练,下一版是否少犯同样的错。模型更新、工具改善和工作流程优化都可能有贡献,不能只看一条活跃曲线就把E填满。

F提供试错余地,也有真实付款约束。2026年二季度集团经营现金流约527亿元,资本开支现金支付约593亿元,披露自由现金流为负138亿元。[1]三项按公司口径分别看,不能简单相减改写,也不是混元独立账本。旧业务能支持新探索,但灵石一出账,就要追它给新供给留下了什么。

腾讯的积极路径,是让模型研究、工作任务与基础设施相互支持:平台发现问题,评测把问题复现,研究与部署共同改进,再用同类工作验证效果。会请高手,可以先把生意做起来;能从每次交付里练厚自己的功夫,才决定下一场是否更有底气。

四|产业视角·交付:同一张账单,几层不同的本事

客户看见的可能只是一个工作产品,背后却站着模型、执行框架、企业系统与云服务。腾讯公开材料已经把多模型工作层和自研模型进入产品分别呈现。[1][2]因此,交付不能画成一团笼统的“生态”:要看任务由谁接、进度放哪里、失败怎样恢复,以及谁承担最终服务。

交付环节/路径主要提供什么客户关系要查什么
工作产品/执行层接任务、编排工具、记录进度与异常客户是否持续投入技能、状态与上线流程
混元及其他模型提供推理、生成与工具选择能力换模型后结果、成本与重验证工作如何变化
企业系统/客户提供资料与权限,定义业务验收哪些资产留在客户自己的通用系统中
云与商业服务提供资源、计量和支持;合同逐项确认模型、工具、渠道与运维成本怎样分摊

这些职责在实际合同中可以重合,也可以由不同主体承担。客户保留自己的资料与系统,不代表平台没有价值;恰恰可能因为平台处理了繁琐的授权、执行与异常,小企业才不必自己造一遍。腾讯有机会取得的,是组织工作的价值,而不只是给模型增加一个漂亮窗口。

第一道检验:留着WorkBuddy,换掉混元。用同一批真实任务,固定资料、权限和工具,比较结果、费用、时延与人工接管。如果换一个模型仍能办成,平台可能做得很好,混元专属依赖却较弱;若领域评测、工具选择与运行配方须重新验证,才需要进一步查这些差异是否持续、是否有价值。

第二道检验:留着可用模型,换掉工作平台。长期状态、技能配置、工具连接、权限策略与验收记录,哪些能带走,哪些要重建?这两项是分析方法,并非本文已经取得的迁移实测。真正要辨认的,不是谁把出口修得最难走,而是谁让客户过去的有效投入继续好用。

这两道题可以有不同答案。混元可能因为专业任务能力被指定,工作层可能因为组织与恢复能力被长期使用,二者也能互相增强。使用别人的模型不等于平台失败,平台生意好也不等于自研模型领先。客人信任一家诊所,既可能信医生,也可能信会诊、记录和后续照料;一张挂号单,不能把功劳全归给同一门医术。

收益还要追到实际账单。一次订阅可能包含模型、工具、计算与支持;出了故障谁处理,新增工作由谁付费,合作条款由谁决定,都会影响商业位置。平台越深入承责,越有机会降低客户的协调负担,也越要承担连续服务的成本。组织得好,是新生意;只增加一层传话,可能先增加一层费用。

从增能到承责,再到丰裕,交付不是把功能往上叠,而是让不同环节少重复建设、让可靠结果更可负担。新方法能被部署、新工具能被继续使用,才有破界与创生的后续空间。腾讯是否会走出更大的新业务,值得沿这条工作链看,而不是只在入口和模型之间选一个赢家。

五|投资视角:模型与工作平台,不能共用一张丹证

把产业关系拆清,金印五阶就不再是给公司贴称号。混元有自研路线,工作产品有采用,两锚不是空想;两定还要看供给能否反复有效、外部客户能否持续选择。因此,本期仍在筑基中期向后期验证,不用腾讯旧业务的修为替新模型补考。

要往后期走,先查客户为什么选混元:任务质量、完整成本、服务稳定性各有什么作用?默认设置、优惠与旧采购关系也可能帮助成交,但不能把平台总请求增长全部认作混元的市场位置。公司对健康留存和较高付费意愿的描述是正面线索,[1]下一步要看同一批客户的正式付费、使用范围与续约。

金丹则是客户开始把下一轮工作建在这里。技能与评测不用每个项目重做,权限和上线规则能跨版本延续,预算与维护团队持续存在,下一次选择便不再只有一张模型价格表。客户愿意留下,是因为已有投入更值钱,而不是因为某个版本留下了太多补丁,谁也不敢动。

对腾讯,模型与工作平台可能不同步。工作层先形成持续投入,就在这层确认价值;混元成为被指定的供给,也单独举证。平台依赖可能带来更稳定的任务与反馈,模型进步又可能帮助降低交付成本,但两者需要真实协同。宗门能同时练两门功,不必强行让两颗丹同一天出炉。

元婴再问:新的工作方式是否改变了专业服务的分工,终端客户或上游Agent是否主动指定它,伙伴能否按共同规则经营,原厂是否在完整成本后留下合理收益?这里要看两穿和两高两稳,不拿游戏、广告或支付的旧利润答题。平台若能让伙伴有生意、客户有结果、自己有回报,实权才开始有耐久性。

更远的化神,是同一套有效能力进入新客户、新产品,团队能持续纠错,资本配置不靠反复堆投入维持原地位。对腾讯值得期待的,是从熟悉人的入口,走向组织人和Agent的工作;眼下不必替它封神,也不必因混元还未结丹,就忽略工作平台可能先长出的新位置。

六|交易视角:旧钱袋能助阵,新账不能靠借

集团财力是支持条件,不是混元独立利润表。打包订阅要拆补贴、模型分成、工具费用与必要再投入;缺少新AI经济性,就不拿集团市值除以局部收入宣布便宜。沿准入、定仓、估值、共修、退出守住条件,用新证据修正认识,不给每次发布配一个买点。公司未来可能化元婴,今天的价格却不能替它先领取那份收益权。

七|共修观察:看下一次工作,为什么还交给它

近期只抓两条主线。一条是混元自己的技术与市场选择:把自研实际负载和外部付费辨认出来,用固定任务比较质量、费用、时延与接管,再追持续采用。另一条是工作平台的实际交付:任务能否少交接、少返工、稳定验收,客户下次是否还愿意把工作放进来。

这比追着总用户数跑更有区分度。用户回来,可能要用混元,也可能是来用另一家模型;他愿意维护技能、评测、权限与工作状态,才让我们看到长期建设的方向。混元若被轮换而工作层继续增长,首先应当厘清依赖归属,而非宣布整家公司失败。

元婴的远期观察,继续落到这套新业务能否组织生产、维护合作并留下收益,而不是把门口热闹当成已经有定价权。

元婴观察主线本家公司要具体证明什么
重构生产新工作体系能否减少跨系统交接,并形成可持续交付的专业服务
影响终端客户或其他Agent是否主动指定其服务,而不只是使用默认入口
穿透分配分清平台、混元、第三方模型与渠道的贡献及可留净收益
取得规则权交付、收费和合作规则变化后,客户与伙伴是否仍愿持续建设
两高两稳兑现新AI业务的高质量收入与客户、毛利、现金及资本回报相互印证

反证也应具体:促销一停就不续付,模型更新总要重搭流程,或者平台承担越来越多异常与运维,却留不住相应收益,都要收紧判断。若旧资产随升级变得更有用,伙伴愿意继续经营,客户通过更少协调获得更好结果,则说明这条路正在变厚。

腾讯最值得期待的,不是让客户多打开一次软件,而是让客户少操心一段工作,还愿意把下一段继续交来。模型提供本领,平台组织本领;能把本领变成长期值得参加的分工,才有机会长出新的产业实权。

下一篇看字节。同样擅长产品,它面前还有另一道反差:过去让人舍不得走,未来让事情办完、人放心离开。两门好生意,能共用多少功夫,又必须换掉哪些成绩单?

资料与研究口径

研究资料至2026年9月。排名按公告中的地域、终端、月份与指标理解;公司自述、内部评测与实际客户结果分别看。供应商对账及双向替换是分析场景,不是已完成的客户实测。集团自由现金流按公司定义列示,不机械改写为经营现金流减设备款。

[[1] 腾讯|2026年第二季度业绩公告](https://www.prnewswire.com/apac/news-releases/tencent-announces-2026-second-quarter-results-302849608.html)

2026-08-12,未经审计业绩。WorkBuddy领先口径为指定月份中国PC端AI原生办公Agent的交互次数;留存为定性描述。集团现金流不能用来推混元独立利润。

[[2] 腾讯|Hy3正式发布与产品整合](https://www.tencent.com/tencent-hunyuan-officially-releases-hy3-advancing-agent-capabilities-and-deeper-product-integration/)

2026-07-06,官方产品说明。Hy3接入工作产品与业务反馈迭代的披露,不等于全体外部客户的队列结果。

[[3] 腾讯|Hy4-preview官方模型卡](https://huggingface.co/tencent/Hy4-preview)

Hy4-preview技术与部署资料。163名内部专家、203个任务的盲评不是全球客户抽样;已知的推理过长与过度验证问题不外推为所有任务均低效。

[[4] 腾讯研究团队|WorkBuddy Bench论文](https://arxiv.org/abs/2607.20911)

2026-07-23,原始研究。代码、网页、办公、安全任务及降低污染的构造方法;研究任务不等于全部实际客户工作。

研究说明:阶段与评分属于本系列的研究判断,不是行业统一评级;未来情景不构成投资回报承诺。

声明:本文由 AI 辅助整理初稿,经作者人工审核、补充实战案例与方法论解释后定稿。核心观点与案例判断为作者原创。