
如果一个 AI 只花十几分钟、几毛钱,就能替你完成一项原本需要两三个小时的办公任务,你会把工作交给它吗?
先别急着回答。
百度研究团队刚刚发布了一套很有意思的评测。他们没有继续问模型数学题,也没有只看 AI 能不能点中某个按钮,而是准备了 100 个真实办公任务,让 AI 直接交 Word、Excel、PPT 和 PDF 成品。
结果很矛盾:AI 确实更快、更便宜,但做出来的东西,离「拿来就用」还差得很远。
这可能是最近最接近普通人真实工作的一次 AI Agent 测试。
一次测试,专门盯着最后交上来的文件
过去很多办公 Agent 评测,考的是操作过程。
比如:有没有打开正确菜单,有没有把文字粘贴到指定位置,有没有成功保存文件。只要最终界面状态对了,任务就算完成。
可真实工作不是这样。
老板不会因为你点对了 30 次鼠标就给报告通过。客户也不会因为你的 Agent 成功调用了 Excel 工具,就接受一张公式算错、样式混乱的表格。
大家只看最后的东西能不能用。
这套名为 OmegaUse-OfficeVal 的基准,恰好把评测重点放在最终交付物上。它收录了 100 个由实际办公需求改编的长任务,涉及文档、表格、演示文稿、PDF 等常见格式。每个任务平均需要人类工作 2.32 小时。
研究团队还给每项任务标注了两种经济信息:人类要花多少时间,以及这项工作在市场上大概值多少钱。这样一来,比较的不只是「谁分高」,还有「谁更快」和「谁更省钱」。
为了减少主观判断,他们没有让另一个大模型当裁判,而是把细化后的评分规则写成代码验证器。这个设计不完美,但至少避免了「AI 做作业,再让 AI 给 AI 打分」的尴尬。
最强模型只拿到人类六成多的分数
研究团队测试了 GLM-5.2、Qwen3.7-Plus、Kimi K2.6、DeepSeek-V4-Pro 和 MiniMax M3,并加入人类结果作参照。
成绩如下:
| 执行者 | 平均分 | 平均成本 | 平均用时 |
|---|---|---|---|
| 人类 | 27.79 | 6.8560 美元 | 2.324 小时 |
| GLM-5.2 | 17.91 | 1.4823 美元 | 0.521 小时 |
| Qwen3.7-Plus | 17.51 | 0.2152 美元 | 0.193 小时 |
| Kimi K2.6 | 17.00 | 0.7719 美元 | 0.389 小时 |
| DeepSeek-V4-Pro | 14.48 | 0.6111 美元 | 0.184 小时 |
| MiniMax M3 | 13.82 | 1.7572 美元 | 2.275 小时 |
GLM-5.2 的平均分最高,17.91 分,大约是人类基线的 64%。Qwen3.7-Plus 只低了 0.4 分,但平均成本只有 0.2152 美元,约合人民币 1.5 元。
单看这张表,AI 已经很划算。
以 Qwen3.7-Plus 为例,平均 0.193 小时就能交付,约 11.6 分钟;人类平均需要 2.324 小时。它的速度约为人类的 12 倍,实验中的推理成本也低得多。
但别忘了最重要的一列:质量。
这些模型不是在同等质量下更便宜,而是在交付质量明显落后时更便宜。把「十几分钟完成」写成「十几分钟替代两小时人工」,就把论文最重要的限制删掉了。
真正刺眼的是零分率
平均分还会掩盖一个问题:有些任务,AI 不是做得差一点,而是直接交了一份无法得分的结果。
- GLM-5.2 有 14% 的任务得分超过 50,是所有模型中表现最好的。
- Qwen3.7-Plus 的零分率最低,但仍然达到 38%。
- DeepSeek-V4-Pro 和 MiniMax M3 的零分率分别为 50% 和 51%。
在当前实验设置中,即使是零分率最低的模型,也有超过三分之一的任务完全失败。
这和我们日常使用 AI 的感受很像。
让它从一份表格里提取字段,往往做得不错。让它给已有内容加标注,也比较稳。一旦任务涉及复杂排版、模糊审美、多个文件之间的约束,或者需要它自己判断什么叫「像一份能交付的成品」,问题就开始堆积。
论文也观察到了类似差异:GLM-5.2 在工程与技术类任务上领先,Qwen3.7-Plus 在业务运营类任务上更好,DeepSeek-V4-Pro 在学术论文类任务上占优。金融数据任务则普遍困难。
这说明当前没有一个模型可以稳定接管所有办公工作。不同模型各有擅长的区域,任务类型和 Agent 的执行框架都会影响结果。
AI会操作软件,不等于它懂得交付
这次评测最值得关注的,不是模型排名,而是「操作成功」和「交付成功」之间的距离。
传统自动化软件很笨,但它足够确定。你写好一条规则,它就重复执行这条规则。AI Agent 的能力强得多,它能理解自然语言,能跨多个工具,也能临场处理没有写进脚本的问题。
代价是,它会自己判断。
而办公任务里最难写清楚的,偏偏也是判断:这个标题够不够醒目,这张表是不是一眼能看懂,这页 PPT 有没有把重点说透,遇到缺失数据时应该停下来询问,还是按经验补齐。
人类同事在工作中会不断确认这些问题。Agent 则很容易一路做下去,直到交出一个结构完整、文件也能打开,但细看处处有问题的成品。
它没有卡住,也没有报错。它只是把错误做完了。
这比软件崩溃更麻烦。软件崩溃时我们知道任务失败了;AI 交出一个看似完整的文件时,人很容易放松检查。
今天最合理的用法,是让AI做第一遍
看完这组数据,我不会得出「AI 办公没用」的结论。
恰恰相反,十几分钟、几毛到几元的成本,已经足以改变大量工作的起点。资料整理、字段提取、格式转换、初稿生成,这些耗时但判断密度不高的工作,很适合先交给 AI。
问题出在最后一步。
现阶段,AI 更像一个速度很快、价格很低,但必须有人验收的执行者。你可以让它做第一遍,不能默认它有资格按下「最终提交」。
我更建议采用四步流程:
- 先把需求和验收标准写清楚。不要只说「做一份汇报 PPT」,要说明受众、页数、必须保留的数据和禁用内容。
- 让 AI 分阶段交付。先确认提纲,再确认数据,最后生成文件,不要等全部做完才检查。
- 用检查表验收成品。表格查公式和单位,PPT 查信息层级和裁切,PDF 查字体、分页和链接。
- 让人对最终结果负责。涉及金额、合同、客户数据和对外发布时,这一步不能省。
这里有个很现实的判断标准:如果检查 AI 成品所花的时间,比你自己完成任务还长,那这项工作暂时就不适合交给 Agent。
便宜的执行力,仍然需要昂贵的判断力
过去我们讨论 AI 办公,常问的是「它会不会做」。这套测试把问题往前推了一步:它做出来的东西值不值得用?
答案并不悲观。
AI 已经能用很低的成本完成相当一部分工作,也能在某些任务上交出可用结果。但平均分和零分率提醒我们,它的稳定性还不够。尤其面对长流程、模糊要求和最终成品质量时,人的判断仍然是交付链条里最贵、也最难省掉的一环。
所以,眼下真正有效的 AI 办公方式,不是把电脑彻底交出去,而是把重复劳动交出去,把验收权留在自己手里。
资料来源
- 百度 Agent Frontier Team,OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
- arXiv:2607.27155
- 论文全文:arxiv.org/html/2607.27155
说明:这是一项包含 100 个任务的新基准,结果受任务构成、模型版本、Agent 执行框架和评分方式影响,不宜直接外推到所有办公场景。
