旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

腾讯WorkBuddy火了,字节和阿里急了

7月20日至30日,腾讯、阿里、字节短短十天内结束赛马,将资源押宝办公Agent。目前WorkBuddy领先,这场战争是组织能力总决赛,胜负犹未可知。
·微信公众号:IC实验室 IC实验室 IC实验室

AI投资人解读

· 办公Agent成互联网大厂必争之地,WorkBuddy月访问量居首。豆包C端优势明显,但在办公Agent赛道面临挑战。腾讯凭借生态优势,字节整合资源,阿里借助丰富工具,各方竞争激烈。
· 行业竞争激烈,产品心智重塑困难,组织能力要求高。
总结:办公Agent赛道潜力大,腾讯、字节、阿里各有优势与挑战。在竞争激烈的市场中,谁能更好地打通各环节,满足用户需求,将在这场战争中占据上风,同时需关注竞争和产品转型等风险。

办公Agent,已经成为国内互联网大厂的必争之地。

腾讯、阿里、字节,三家公司在短短十天内,几乎做了同一件事:结束赛马,把更多的资源押宝在办公Agent上。

7月20号,腾讯内部通知Qclaw并入WorkBuddy所在部门统一管理。

一天后,阿里整合了旗下多个产品,推出千问办公。

到了7月30号,字节将飞书团队并入了豆包。

有意思的是,在消费级AI应用上,豆包的月活是3.82亿,腾讯的元宝只有4984万,前者是后者的8倍。

但在办公Agent这个赛道上,WorkBuddy却以月访问量2097万次稳居第 一,超过字节跳动Trae(1279万)和阿里QoderWork(788万)的总和。

明明在消费级AI应用上有着绝 对优势,字节依然在内部做出这么大的调整,可见WorkBuddy确实给了字节很大压力。

这也侧面反映了,办公Agent,已经成为国内互联网大厂的必争之地。

接下来这场战争,会不亚于过去互联网时代任何一场大战。

原因也很简单,Chat时代已经结束了,以Chat作为AI产品的时代也迎来了终结。

这期内容,我们就来讲清楚,这场大战背后的逻辑。

如果你关注AI的信息,想必经常能看到LLM、skill、harness、loop等等一堆名词。

但我们可以暂时不关注这些。只从应用产品来讲,我认为只用分成两个时间段:Chat和Agent。

在ChatGPT发布以后,大众认识大模型的方式,基本就是被一个对话框定义的。

我们输入一句话,它就回复一段内容。

让它改一下文案、简历,翻译一下单词,聊聊情感问题,乃至算命。

总之,大部分人对于这类产品的用法,更像是一个搜索pro max版。

我们负责提问,模型则负责生成答案。

这就是Chat阶段。

在这个阶段里,模型的能力,和产品体验的关系,可以说非常直接。

模型聪明一点,回答就准确一点。上下文长一点,就能阅读更多资料。推理能力强一点,复杂问题就不容易答错。

所以大家总爱用一些刁钻的问题去测试模型,比如经典的「我打算去100米外的洗车店洗车,我应该步行去还是开车去?」。

甚至为了更好地跟大模型沟通,人们还要学习如何优化prompt,也就是提示词。

前几年,一段准确的提示词甚至会被广泛复制。

可以说,随着大模型越来越聪明,这些沟通方式也在飞速进化。

不过这不是本期重点,有机会再专门讲一下。

总之,大众对AI产品的第 一印象,基本就在「你问我答」上面。

这点从阿里给自己大模型取名叫「千问」就能看出来。这里我得吐槽一下,阿里这个取名,显然是对AI的判断,短视了一点。

豆包能在这个阶段脱颖而出,关键就在于她的产品更加拟人,更加接近于人们想象中的「聊天对象」。

正是靠着对于Chat类产品的深刻理解,豆包可以说是暴打其他类产品。

但问题是,聊天类产品,虽然有趣,但离生产力还远得很。回答问题,并不等于交付结果。

打比方说,我要去北京出差几天,要做规划。

我会问AI,哪些航班合适?哪些酒店性价比比较高?能否给我列一个时间表?

因为有海量的知识和信息,这些答案显然比过去百度准确多了,也更加高效。

但在这个过程里,我得到答案后,还是需要自己去订航班和酒店,需要把我的时间表,专门发给AI,才能帮我整理。

再比如我们日常工作里,希望AI给我分析数据、规划方案、制作PPT等等,都需要进行多个对话,由我把问题和资料发给AI,AI回答我怎么去做。

实际的工作者,依然是我。

Chat时代的AI,打个不恰当的比方,就是你被退婚以后空间戒指里的老爷爷。

他可以指导你修炼、炼丹,给你科普知识、答疑解惑,但是不能直接干涉你的修为。

是挂,但是不如系统挂。

这也就决定了Chat类产品商业化上的困境。

答案的价值很难计算,也没有什么护城河。用户今天可以用豆包,明天也可以用DeepSeek、千问和元宝。

只要回答的差距没有大到不可替代,切换成本就非常低。

而大模型每次回答都是消耗算力的。

传统的互联网产品是用户越多,广告和交易收入也就越高。但Chat类产品一直是c端用户越多,成本就越高。

至于像过去那样靠广告盈利,也很困难。

传统的互联网做广告依靠的是分发和流量,但AI产品相反,是信息提炼和整合,植入广告观感极差。

最后还是那句话,用户切换成本低。

另外说一句,这点从百度身上就能看出来。

你说百度的文心一言跟其他国产模型有代际差距吗?并没有。

但正因为在搜索时代,百度的竞价排名过于深入人心,导致进入AI时代,压根没有用户信任百度的模型。

大家都不信你模型给出的答案,怎么可能用你的产品呢?

总之,豆包3亿多月活固然厉害,但Chat类AI产品的月活,并不像过去互联网时代产品那样金贵。

而Agent,恰好能解决这个问题。

Agent,也就是智能体这个词,在万事皆可AI的今天,其实有点泛滥了。

很多产品里加个AI插件和按钮,就说自己是Agent。

我个人觉得,判断一款产品是不是Agent,有个很简单的标准。

那就是当我给它一个目标以后,它是否能自己理解、制定计划、调用工具,最后给我结果。

比如还是刚才出差的案例,我只用告诉它出差的时间、地点和预算需求等等,然后它就调取上下文,读取了我的日历、偏好,再调用工具,帮我锁定航班、规划酒店。

最后只发给我确认,然后机票、酒店出票,日程同步完成。

做报表和PPT也一样,我只提需求,它自己去读取我文件夹里的资料,然后分析,做好PPT,再放到指定的位置。

当然,这个过程里,它可能会误解我的需求,可能会卡在接口上,也可能做出一份完全错误的报告,关键的地方依然需要人来完成。

但是,人和AI的分工已经完全变了。

之前是AI说,人来做。

现在是人确定任务目标,AI来执行,人最后验收。

如果我们把大模型理解为一个大脑,Agent主要则是给这个大脑装上了眼睛和手脚。

眼睛就是上下文,它需要知道哪些信息、数据、资料和当前的任务有关。

手脚则是工具,它可以去操作浏览器、读取文件、运行代码等等。

这些东西组成了基本的Agent。

在这个基础上,再给它开放权限、加入各种技能、引入到公司的工作流中等等,相比Chat时代类似顾问的角色,Agent完全就成了生产力工具。

而一旦成了生产力工具,市场就必然愿意付费了。

最 先把这条商业化路径跑通的,是编程。

用过这些Agent的,比如WorkBuddy、Trae或者Codex的朋友,应该都会发现一个有意思的现象,就是这些Agent的界面非常相似,都是三栏布局。

左侧是文件夹,中间是工作区,右侧是产物展示。

最早将这个界面发扬光大的是Cursor。

简单来说,Cursor就像是程序员的Word,而Cursor在旁边放了一个AI编程助手。

你只需要告诉它「我要改什么」,它可以直接阅读项目、修改代码、排查错误等等。

但是Cursor本身没有强大的模型,它只是一个优秀的壳。

转折点发生在2024年6月,Anthropic发布了Claude 3.5 Sonnet。

这个模型在编程方面碾压了当时的GPT-4o。Cursor+Claude 3.5 Sonnet的组合,直接让写代码的体验从「人工智障」变成真正的帮手。

正是这个组合,不仅让Anthropic靠着天量的API调用赚翻了,更向全行业证明了编程在商业上的价值,同时也让这种三栏界面+大模型的组合,成了后面办公Agent的标准范式。

因为说到底,不管是编程,还是写作,还是制作PPT,工作的底层逻辑是非常相似的。

现在市面上各种售卖如何使用WorkBuddy的课程,其实不如理解这个逻辑,很简单就能上手这些办公Agent。

至于为什么是编程最早被验证,一个原因当然是程序员天然离AI最近,最容易理解这套逻辑。

另一个是相比文章写得好不好,PPT做得漂不漂亮,编程的目的更容易被判断。

当编程Agent开始节省了程序员的大量时间,订阅费就不再像Chat的问答模式那样难以解释。

企业和用户购买的不再是聊天,而是可以计算的生产力。

这个就是Chat和Agent在商业上的根本差别。

当然,Coding Agent对于模型能力的要求非常高。

但是对于办公Agent来说,其实未必每一项工作,都需要最顶 级大模型的复杂推理。

大多数办公任务,可能就是整理文件、把会议纪要变成任务清单、写写周报、核对表格数据、批量处理资料、制作PPT等等。

这些工作不容易,尤其是一些涉及业务判断的地方。

但是,这其中其实存在着大量重复性、标准化的步骤,最后人只需要验收就行。

所以对于这批任务来说,只要一个模型能跨过基本线,能做到找到文件、操作软件,然后交付结果,那么产品和生态的权重,就会快速上升。

而这里,就是办公Agent角逐的战场。

WorkBuddy其实就是个很好的案例。

腾讯的大模型是混元,但WorkBuddy却不是混元团队独立做出来的,而是起源于腾讯云开发AI代码助手的团队。

这个产品最早叫CodeBuddy,但是团队发现公司很多人并不拿它写代码,而是用来办公,于是把架构平移到了WorkBuddy,并在今年3月公测,很快就占领了办公Agent市场。

腾讯能这么早转型成功,其实我个人觉得,相反跟它的大模型没那么强有关。

腾讯最早推出元宝的时候,混元这个模型就还非常不成熟。

所以等DeepSeek-R1大爆的时候,元宝很快就接入了DeepSeek,迎来了一波产品增长。

腾讯不需要死守着自家模型,相反可以为了产品的增长,欢迎接入更多的模型。

在编程领域也一样。

编程当然是个非常诱人的市场,但程序员离AI最近,工作对智能要求最高,所以非常追求顶 级模型。

从最初Cursor和Claude的合作就能看出来,程序员最终会跟着Claude走,而不是留在Cursor。

因为模型不强,腾讯也压根没啃下什么编程市场,基本都是内部使用,所以转型成办公也没什么压力。

最终,WorkBuddy出现,采取了支持多种模型的产品形态。

简单来讲,腾讯打造出了一个不错的身体,并且允许用户随意切换脑子。

这个方向,意外成为了腾讯最擅长做的事,可以说是腾讯的甜蜜点。

为什么这么说呢?

因为现在大模型能力可以说是日新月异,很快大部分模型就突破了大多数人办公需求的基本线。

大脑可以外接,但是对身体来讲,整个生态未必能速成。

办公Agent所需要的人跟人的连接、知识库、文档功能等等,恰好腾讯全都有。

甚至腾讯文档这种我觉得半死不活的产品,在接入办公Agent以后,都可以救一下。

其实目前腾讯的生态,跟谷歌是最像的。

谷歌账号是很多软件的登录账号,微信也是。

谷歌有谷歌文档,腾讯也有。

谷歌有NotebookLM,腾讯有ima。

谷歌的大模型Gemini现在处于掉队状态,诶,您猜怎么着,腾讯的混元压根也没跟上过。

唯独就是,谷歌在开发Agent产品上,实在太慢了。

字节在这点上,跟腾讯刚好有点相反。

豆包当然是很有优势,3.28亿月活,在C端市场可以说秒杀元宝,是个非常巨大的入口。

同时呢,字节的seed模型、飞书、火山引擎等等,生态完全不输腾讯。

但豆包有一个问题就是,它在Chat时代太成功了,以至于大部分已经将它定位成一个Chat产品。

过去几年,豆包在聊天陪伴、实时语音等等这些轻量玩法上,做得非常成功。

包括在市场覆盖面上,甚至很多老人都开始使用豆包。

他们也无所谓哪个模型,就是知道,有什么事情都先问一下豆包。

这些使用方式给豆包带去了巨大的日活,但是也塑造了它的产品心智。

那就是用户打开豆包,首先想到的是问它点什么东西,而不是交给它一个任务。

这个现象也体现在豆包收费以后。

今年6月,字节正式推出「豆包专业版」,但大部分用户都没理解这个产品为什么需要付费,以及专业版跟平时用来聊天的豆包有什么区别。

这也是为什么在7月底,字节急着把豆包和飞书大合并。

只有把飞书这个纯粹的办公产品,与豆包结合起来,才有可能在办公Agent赛道继续竞争。

在这点上,腾讯、阿里、字节,三家做出了共同判断。

那就是结束赛马,把所有产品、资源尽量收拢到同一个办公Agent上。

因为大厂发现,AI竞争的基本单位,已经变了。

Chat时代,模型团队只要交出一个更好的模型,前端产品就能很快感受到提升。

但在Agent时代,必须打通模型、工具、数据、权限和交付多个环节,才能变成用户想获得的结果。

因此,办公Agent的战争,也成了一场组织能力的总决赛。

三家都各有优势。

字节有最 好的视频模型,有抖音、豆包的流量,有飞书的企业协作,火山引擎等等。

阿里同样也不缺。千问模型、钉钉的组织关系、阿里云企业用户,再加上电商、支付、本地生活服务等等,同样拥有非常丰富的任务工具。

腾讯的WorkBuddy暂时领 先,本身又有企微和微信入口这个天然优势,当然微信最终会开放多少,是否愿意让Agent完全接入(不算openclaw),还要另说。

所以三家谁胜谁负,还犹未可知。

办公Agent的爆火,也带动了网上各种课程。

现在乱七八糟教你怎么用WorkBuddy的,用Codex的,卖skill的等等,动不动就是「惊呆了」,「颠覆行业」,「必须学会使用这个」。

我这里其实也想分享三个经验,只针对还没怎么使用这些AI工具的,大家姑且一听:

第 一,不管哪家的办公Agent,先下载一个下来用用。

大部分办公Agent的操作大同小异,用会一个,其他自然就会用了。

我并不想散播焦虑,但是在AI时代,掌握一下Agent的使用技巧,我认为还是有必要的。

第二,是下载一个Obsidian。

暂时不用去细究怎么使用,就记住它是你的知识库。

你和AI交流出的有价值的东西,交付出你认为日后可以复用的东西,先保存在Obsidian再说。

至于如何整理,完全也可以交给AI。

第三,不要买任何课程。

AI最 好的地方就是你可以问它任何问题,包括如何使用它自己。

把自己的目的和工作内容告诉AI,让它帮你规划,比网上任何一节课都有用。

最后,WorkBuddy暂时的领 先,意味着腾讯会在Agent时代,再次领跑吗?

我觉得未必。

或者换个问法。

Chat时代结束,但Agent时代就是终局吗?

真不一定。

我们可以看到的是,目前AI还处于一个高速发展的时期。

无论是大模型还是产品,都在以月度、季度的时间在迭代。

Gemini去年我还觉得是唯 一真神,今年谷歌仿佛就成了AI圈外人。

从Chat到Agent,也不过意味着,我们从信息交互进入了任务执行的时代。

如果我们假设一个终局:

任何人类可以在电脑上完成的事,AI都能完成,并且完成得更好。

那么,AI最后可能就像是许愿机一样。

既无人关心背后的模型是什么,也无所谓调用什么工具。

只要告诉它,我要一条IC实验室的内容这一件事,它就几分钟内生产出来了。

或许到了最后的最后,甚至把电脑这个限定条件,都可以拿掉:

任何人类可以完成的事,AI都能完成,并且完成得更好。

【本文由投资界合作伙伴微信公众号:IC实验室授权发布,本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。