2026年,办公软件市场正在经历一场由Agent驱动的范式转移。硅谷科技巨头微软、谷歌和OpenAI正将办公从“人操作软件”转变为“人交代任务、Agent操作软件”的模式,而国内市场的竞争格局则呈现出不同的路径。7月23日,腾讯发布WorkBuddy Bench,将七个头部模型装入CodeBuddy Code和Claude Code两套Agent Harness,完成代码、网页、办公和安全四类共260项任务。其中,办公任务成为模型与Harness变化后表现最稳定的一类,七个模型得分落在77.47至82.37之间,模型与Harness的差异在标准化办公任务中并未拉开明显差距。
这一测试结果揭示了一个关键趋势:Agent执行任务的能力正在成为普遍的基础能力,而竞争焦点开始向两端转移——用户为何愿意将第一项真实任务交给Agent,以及任务完成后为何敢于不再重新检查。微软三名研究人员在7月1日公布的内部研究显示,在数万名工程师的真实使用数据中,“第一次使用”与“持续使用”由不同因素驱动,工程师是否尝试Agent明显受到周围同事影响,论文指出“第一次使用主要沿着社交网络传播”,并建议企业在推广Agent时将“可见的同伴使用”纳入策略。
腾讯在Agent冷启动阶段拥有天然优势。WorkBuddy已支持用户从微信、企业微信、QQ、钉钉、飞书等通信入口远程给电脑下发任务并接收结果,这张覆盖同事、朋友和群聊的关系网恰好适配Agent产品的传播机制。然而,WorkBuddy超过1100万的PC月活并不能简单归因于腾讯的流量优势,产品能力、补贴、上线时间和市场投放都会影响数字,现阶段没有证据证明微信关系链与WorkBuddy增长存在单一因果关系。更准确的说法是,腾讯拥有一项恰好适配Agent冷启动问题的资产。
百度则在另一条赛道上追赶。百度3月正式推出桌面级办公Agent DuMate(中文名“搭子”),截至8月7日个人版已推进至v1.0.67,陆续增加网页发布、内嵌浏览器、远程任务和自动化模板等能力。8月12日,百度披露搭子上线以来日均提问次数增长60倍,近一个月又增长两倍。昨日发布的Q2财报显示,百度AI应用季度收入为25亿元,同比增长3%;6月搭子企业版上线;同期百度文库和网盘的AI DAU渗透率同比增长27.4%。这些收入和用户并非全部来自办公Agent,但意味着百度并非从空白桌面产品开始竞争,其身后还有搜索、文库、网盘等运行多年的信息和文件体系。
百度面临的挑战在于,如果竞争停留在“谁能更快让用户知道Agent能干活”,其搜索、文库和网盘资产难以与腾讯的人际关系网抗衡。因此,百度需要将竞争引向另一道题:证明当Agent干完活以后,用户可以少检查一遍。这正是搜索、专业内容和知识体系可能重新变得值钱的地方。Agent执行任务链条越长,早期错误被放大的空间越大,接入搜索并未彻底解决验证问题。ACL 2026的多项研究仍在专门处理RAG场景中的幻觉检测,其中一项方法直接将生成内容与检索证据对齐,另一项构建长上下文RAG基准的研究发现,现有幻觉检测器距离性能上限仍有明显空间。
办公Agent的竞争正在从“能干活”转向“敢用结果”。腾讯与百度手中的旧资产分别对应这两个问题的两端:腾讯的关系网有助于获取第一项真实任务,百度的搜索与知识体系则可能成为构建证据链的基础。市场远未定型,两家公司都在以不同路径探索办公Agent的下一阶段竞争形态。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。