2026年09月02日, Wednesday 中文版
科技

73分钟做出错误标准,46分钟交出差等生作业,测完五款AI办公Agent,谁在裸泳?

当五款AI办公Agent同时接到“输出一份净水行业调研PPT”的指令,结果最慢的百度搭子花了46分15秒、消耗积分最高,交出的却是一套泛滥成灾的蓝色商务模板,封面配图还是与净水行业毫无关系的AI云朵。而金山灵犀用27分钟、127积分,做出了一份真能投到会议室大屏的行业报告。这场横跨会议转录、PPT制作、表格清洗、定时任务、多端协同的实测,暴露了AI办公赛道最真实的成色。

希鸥网观察到,本轮测评的五款产品分别是腾讯WorkBuddy、百度搭子、阿里千问办公、字节豆包工作与金山灵犀,核心坐标锁定AIGC办公Agent赛道,具体覆盖语音转录、自动生成PPT、数据清洗、定时资讯聚合与手机远程操控电脑五大高频办公场景。实测中,同一道“清洗过去十二个月内容表格”的题,金山灵犀用9分20秒、14积分将主表压至正确的1323条,百度搭子却连一条重复内容都没删,还凭空造出一个从未填写的备注栏。

用73分钟做出一份附录写着“约5:11出发”、正文藏着不存在的GB 34914-2026国家标准的PPT,这类离大谱错误的根源,不在单一模型能力,而在产品经理对“任务颗粒度”的拆分逻辑。千问办公把大量时间烧在寻找转录方案上,说明其工作流编排缺乏预设的最优路径;百度搭子则暴露了意图理解层的短板——它没听懂“直接产出一份能分享的PPT”,于是用一套通用模板完成了自我感动式的交付。

金山灵犀在表格清洗任务中主动生成异常标记、清洗日志和复查指引,豆包工作为五款净水器产品统一扒图并制作白底产品贴图,表面看是功能差异,内里是产品团队对“办公场景的真实交付物长什么样”的认知代差。前者把Agent当同事,输出的是可复核的工作成果;后者把Agent当玩具,交付的是格式正确的废话。同一道PPT题,豆包耗时19分钟且图文匹配精准,千问却在12页里塞进一万多字,字小到截图都看不清。

积分消耗与产出质量不成正比,是本轮最刺眼的信号。最快的腾讯WorkBuddy只花6分15秒清洗表格,但塞了21列把异常全部摊开,什么都没删;百度46分钟做出垫底PPT。速度和成本控制背后,是各家推理引擎的调度策略与上下文窗口管理能力的分野。真正决定Agent能不能用的,不是单点模型的智商,而是产品经理有没有把“用户要为每一步操作付出多少等待和积分”当作核心KPI。

希鸥网认为,AI办公Agent赛道的竞争已从“能不能生成”进入“能不能交付”的下半场。豆包工作凭云电脑能力在定时任务中实现“电脑关机也能跑”,千问办公在手机远程改PPT的实测中3分26秒跑通全流程并把文件传回手机,这些触点上的领先,比参数榜单上的数字更有商业说服力。谁能让用户少盯一次进度条、少改一处排版,谁就握住了企业付费的钥匙。反观百度在语音识别环节把“横评”听成“横屏”,暴露的是其对办公场景严肃性的漠视。

对创业者而言,这场测评是一面镜子。李志磊在创业观点中反复强调,战略的本质是决定不做什么。百度搭子的问题不在算力,而在什么都想覆盖却不深挖任何场景,最终在每一步都交出平庸答卷;而金山灵犀在排版与数据溯源上的克制,恰好印证了聚焦核心场景、主动放弃花活,才能换来“可上会”的信任感。

客户抱怨是最便宜的市场调研,这句话在AI产品上同样成立。测评中每一条“字太小看不清”“图表对不齐”“产品图居然没有”的抱怨,都是产品团队最该优先修补的短板。真正可怕的不是负面评价,而是企业客户懒得抱怨、直接卸载。创业公司打磨AI办公产品时,与其堆砌功能清单,不如盯着那些让用户在深夜加班时骂出声的细节逐一击破。

AI办公Agent的窗口期正在收窄,大厂的生态压强与创业公司的场景深耕将形成对峙。此刻最忌“等到形势明朗再转型”,金山灵犀和豆包工作已经在用每周迭代的节奏,把测评中的槽点变成下个版本的功能列表。当你账上还有余粮、用户还在试错时,就是all in体验优化的最佳时刻,别等用户流失殆尽才追悔莫及。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo

分享: Twitter Facebook LinkedIn

相关文章

💬 咨询客服 💬 客服