📝 写材料
述职、总结、发言稿这类「躲不掉的正经文书」。AI 能替你把烂摊子初稿摞出来,但数字和结论必须自己核——下面每篇都记了它哪里靠谱、哪里藏坏。
实测记录(32 篇)
网页复制的通知空行成堆?三步把烂摊子丢给豆包,约两分钟拿到格式规范的Word。每一步配真实截图,照着点就行,小白也能一次成功。
网页复制的通知排版乱七八糟?三步丢给WorkBuddy,它会拆解任务、分步骤洗成规范Word。每一步配真实截图照着点,最后有个重要的事记得检查。
网页复制的通知乱成一团?三步交给千问办公,右侧面板能看到它一步步怎么干,交货前它还会自己验一遍格式。配真实截图,照着点就行。
网页复制的通知乱七八糟?三步交给TeleAgent,它的执行时间线精确到每步几秒,出了文件连存放路径都直接印在卡片上。配真实截图,照着点就行。
网页复制的通知排版一团糟?三步交给百度搭子,它会先找你授权、再一步步洗成规范Word。节奏偏慢但每步都有交代,配真实截图照着点就行。
网页复制的通知空行成堆?把烂摊子直接丢给ZCode的对话框,它写好清洗脚本跑一遍,连脚本都留给你审查复用。配真实截图,照着做就行。
同一段乱文档、同一条指令,我们让7款国产AI Agent整理成规范Word:最快118秒,最慢450秒,全部格式达标,但有一款悄悄补了内容。七份实测数据与真实截图全公开。
同一段口令把乱原始记录扔给豆包工作模式,8 分 14 秒交回能直接交的《Q3 述职总结》Word。它自己核对数字:224 和 218 对不上就标「待核实」,缺成本就明说算不出 ROI,私事一律不进正稿。本文讲口令怎么贴、那 8 分钟它在干嘛、拿回来怎么核。
同一段口令丢给 WorkBuddy,90 秒交回独立《Q3 述职总结》docx,全场最快唯一满分 9/9。它把「领导让别写」的工单问题写回正文,注明「是否保留请你决定」,ROI 没数据就拆缺项直说。
同一段口令丢给千问办公,5 分 49 秒交回 Q3 述职 Word。它开工先问三题:工单怎么写、ROI 缺数据怎么办、没做完的写不写——全部由你拍板。224/218 双写核实,ROI 三层清单零编造,8/9 分。
同一段口令丢给 TeleAgent,规划四步、写出中间稿,却在转 Word 时挂起 16 分钟,最终只能会话内渲染。交付说明说「保留了响应时长」,正文里却没有——落差要你自己核出来。详录采集事故#1。
同一段口令丢给百度搭子,3 分 51 秒交回 Q3 述职 Word。它自动装技能、派验收子代理自查;六道考题过五道,唯一失分:工单问题和投诉它没写,也没说。文末给六点核验法。
同一段口令丢给 ZCode,没交 Word,只回一张表格,至少 12 个数字凭空编造:350 单、32.4%、45/40/15 年龄结构,原始一里都没有。224/218 冲突还擅自挑 224 写。本文给逐数字核对法。
同一段口令丢给 CatPaw,4 次尝试、3 次重启,全卡在「对话启动失败(1004020011)」。口令 4/4 逐字校验一致,材料没毛病——本地客户端持续故障。这篇复盘 27 分钟全过程。
CatPaw 本地报错 1004020011 起不来,切云端 14 分 15 秒出稿,7.5 分。它最特别:稿子末尾主动标出两处无据内容——「本月 26 号是我建议的」「集中保管是按口径补的」;但预算一句没提,「清了又堆」也没承认。
同一段口令把乱原始记录扔给豆包工作模式,8 分 14 秒交回能直接交的《Q3 述职总结》Word。它自己核对数字:224 和 218 对不上就标「待核实」,缺成本就明说算不出 ROI,私事一律不进正稿。本文讲口令怎么贴、那 8 分钟它在干嘛、拿回来怎么核。
同一段口令丢给豆包,12 分 35 秒交回开场发言稿 docx,9 分满分。它是 7 款里唯一原样照抄「12 户联系、8 户同意」的,可用数字复现 4/6 全场最高。但实测中途它自己更新了、会话整个丢光——这个坑必须知道。
同一段口令丢给百度搭子,3 分 51 秒交回 Q3 述职 Word。它自动装技能、派验收子代理自查;六道考题过五道,唯一失分:工单问题和投诉它没写,也没说。文末给六点核验法。
同一段口令丢给百度搭子,345 秒出稿,docx 828,554 字节,7.5 分。它是 7 款里唯一自报字数与实测完全一致的(642 = 642,零误差),也是唯一命中雷 4 加分项的之一;但返工 6 次全场最多,其中「也代表街道」是越权表述。
同一段口令、同一份乱记录,7 款桌面 Agent 各答 Q3 述职:WorkBuddy 90 秒满分,豆包 9/9,千问 8/9,TeleAgent 挂起 16 分钟,CatPaw 启动失败,ZCode 编 12 个数字。附六雷对照与复跑方差。
同一段口令丢给千问办公,5 分 49 秒交回 Q3 述职 Word。它开工先问三题:工单怎么写、ROI 缺数据怎么办、没做完的写不写——全部由你拍板。224/218 双写核实,ROI 三层清单零编造,8/9 分。
同一段口令丢给千问办公,1 分 41 秒交回开场发言稿 docx,8.25 分——7 款里唯一拿「半通过」的。它把「已联系 12 户、同意 8 户」抬成「绝大多数都表示理解」,把「去年 2 万今年 1 万」软化成「经费和人力都有限」,两处都要人工调回。
同一份台账喂 7 款桌面 Agent,各写一段 3 分钟业主议事会开场发言。WorkBuddy 与豆包并列 9.0,千问 8.25,CatPaw、TeleAgent、搭子、ZCode 四款 7.5——100% 的分化只来自一个雷。
同一段口令丢给 TeleAgent,规划四步、写出中间稿,却在转 Word 时挂起 16 分钟,最终只能会话内渲染。交付说明说「保留了响应时长」,正文里却没有——落差要你自己核出来。详录采集事故#1。
同一段口令丢给 TeleAgent,真实完成 380 秒,docx 10,460 字节,7.5 分。它是 7 款里唯一免返工的(0 次),且文末标了 AIGC 标识;但它把「今年街道只批 1 万」这句藏了,好在交付说明里自陈了理由——比悄悄藏好,比硬写难。
同一段口令丢给 WorkBuddy,90 秒交回独立《Q3 述职总结》docx,全场最快唯一满分 9/9。它把「领导让别写」的工单问题写回正文,注明「是否保留请你决定」,ROI 没数据就拆缺项直说。
同一段口令丢给 WorkBuddy,4 分 45 秒交回《楼道堆物整治议事会开场发言稿》docx,9 分满分。它是 7 款里唯一在生成中途量字数、发现超标、压缩、再复测的一款——初稿 848 字超标,压到 768,终版 751,自报偏差只 1.2%。
同一段口令丢给 ZCode,没交 Word,只回一张表格,至少 12 个数字凭空编造:350 单、32.4%、45/40/15 年龄结构,原始一里都没有。224/218 冲突还擅自挑 224 写。本文给逐数字核对法。
同一段口令丢给 ZCode,docx 10,585 字节,7.5 分。它是 7 款里唯一派出子智能体做视觉验收、迭代 2 版、给出「超时删哪一段」的;但它把「今年街道只批 1 万」误判为「没有台账」,还把这个错误结论连同搪塞话术一起写进了给发言人的备忘区。
同一份真实乱格式通知、同一段口令、统一判据,7 款国产 AI 办公助手表现差异比想象中大得多。
从安全装好工具,到把 AI 初稿改成能交付的 Word/WPS 文档,基层日常材料其实不用等到坐在电脑前。
两段式口令、并行采集截图、统一模板写作、脚本化发布——一次批量产出教程的完整流水线。
这个场景里实测过的工具
- 豆包9/10
字节出品的 AI 办公助手,118 秒洗净一份乱格式通知。
- WorkBuddy9/10
多 Agent 协作面板,任务拆分能力强,复杂活可以并行干。
- 千问办公8/10
通义千问的办公场景上手,一句指令整理排版并输出文件。
- TeleAgent7.5/10
中国电信出品的桌面办公 Agent,过程时间线精确到秒。
- CatPaw7.5/10
忠实度最高的一款:编号称呼全保留,内容零改动。
- 百度搭子7.5/10
百度桌面办公 Agent,自报字数零误差,节奏偏慢。
- ZCode7.5/10
偏工程风格的 Agent,交付可审查的脚本和完整过程。
- DeepSeek8.5/10
国产对话助手,擅长讲道理、给思路,手机号可直接注册。
- Kimi8.5/10
月之暗面的助手,长文档处理是它的看家本领。
- 通义千问8/10
阿里的 AI 助手,问答、写作、读文档都能接,和千问办公同门。
- 智谱清言8/10
智谱 AI 的对话助手,回答稳、界面简单,适合当主力之一。
- 腾讯元宝8/10
腾讯的 AI 助手,能联网搜资料,和微信生态衔接顺。
- MiniMax7.5/10
回答风格直接的对话助手,适合换着用、对比着用。