2026年9月,有测试者将同一份脏销售流水表、同一句提示词分别交给腾讯WorkBuddy、阿里千问办公和字节豆包工作三款办公Agent产品,要求其完成Excel处理、PPT生成和文字摘要。测试于9月13日完成,涉及三个macOS构建版本:WorkBuddy AI 5.5.2、千问办公1.0.5(build 26090806)、豆包工作2.29.7。结果显示,三家均完成了数据清洗并交付带公式和原生图表的工作簿,但算出的季度总额差异显著,最高比最低多出57.7%。
测试素材刻意混入了不同日期格式、单位不统一、千分位、退款、跨季度订单、部门缺失和异常金额等真实办公场景中的常见问题。千问办公给出的结果为33单、Q1总额1,351,900元,其中华东539,400元、华北434,400元、华南356,000元,部门缺失的22,100元保留为“未标注部门”。三家在交付形式上均达标,但在关键数字口径上出现明显分歧,说明办公Agent在业务事实判断层面尚未形成一致标准。
三款产品虽同属办公Agent品类,背后路线差异明显。腾讯将WorkBuddy定位为Agent时代的平台底座,开放Skill、Expert和Connector,To B属性最重;阿里把千问办公嵌入钉钉,依托组织入口和多模型供给;字节的豆包工作则基于飞书企业上下文,以独立客户端和手机远程操控电脑形成差异。三家公司押注的分别是平台、入口与企业上下文。
2026年夏天前后,三家公司先后对内部办公AI进行组织调整。阿里将钉钉、MuleRun、CoderWork与千问办公纳入同一负责人体系;字节把分散在飞书、TRAE Work、扣子中的能力向豆包体系集中;腾讯于9月2日上线开放平台,将WorkBuddy从桌面工具推向平台底座。调整的核心并非换模型或加功能,而是重新划定团队、产品和生态边界。办公Agent需要接住文件、账号、权限、记忆和任务状态,内部产品各自为战会导致上下文和授权割裂。
三家公司均将编程Agent与办公Agent分线运营:腾讯保留CodeBuddy与WorkBuddy,阿里分开Qoder与千问办公,字节区分TRAE编程线与豆包工作线。编程Agent面对编译器、测试和明确报错,办公场景则缺乏可验证的裁判机制。公式可以验证,某笔异常订单该不该计入却无法“编译”。技术可以搬移执行框架,但业务事实、组织口径和签名责任无法随之迁移。
计费层面,腾讯和阿里均以“积分”作为消耗单位,但两个积分体系没有共同汇率,也无法直接换算为具体任务的价目表。厂商公布了积分有效期、扣减顺序和消耗机制,却未公布任务级定价。办公Agent已越过能否替人做事的基础门槛,开始争夺工作执行层的位置,但用户仍缺少统一标准去比较一次执行的实际成本、决策范围和后续核对工作量。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。