文章
AI 工具实战教程、横评选型与踩坑记录,来自内容仓持续更新。
同一段口令丢给 CatPaw,4 次尝试、3 次重启,全卡在「对话启动失败(1004020011)」。口令 4/4 逐字校验一致,材料没毛病——本地客户端持续故障。这篇复盘 27 分钟全过程。
CatPaw 本地报错 1004020011 起不来,切云端 14 分 15 秒出稿,7.5 分。它最特别:稿子末尾主动标出两处无据内容——「本月 26 号是我建议的」「集中保管是按口径补的」;但预算一句没提,「清了又堆」也没承认。
不用装软件、不用写代码,一条 issue 把需求写清楚,cnb.cool 里的 AI 程序员 CodeBuddy 3 分 55 秒交出一个能玩的色彩反应力小游戏,还自动建好云端预览链接(实测从创建到地址能打开 1 分 2 秒)。12 张实机截图覆盖从注册到玩到结算,需求口令可抄,坑的原因一条讲清。
用这篇短文验证 Markdown 到公众号草稿箱的自动化链路,从排版、图片到推送全程留证。
同一段口令把乱原始记录扔给豆包工作模式,8 分 14 秒交回能直接交的《Q3 述职总结》Word。它自己核对数字:224 和 218 对不上就标「待核实」,缺成本就明说算不出 ROI,私事一律不进正稿。本文讲口令怎么贴、那 8 分钟它在干嘛、拿回来怎么核。
同一段口令丢给豆包,12 分 35 秒交回开场发言稿 docx,9 分满分。它是 7 款里唯一原样照抄「12 户联系、8 户同意」的,可用数字复现 4/6 全场最高。但实测中途它自己更新了、会话整个丢光——这个坑必须知道。
同一段口令丢给百度搭子,3 分 51 秒交回 Q3 述职 Word。它自动装技能、派验收子代理自查;六道考题过五道,唯一失分:工单问题和投诉它没写,也没说。文末给六点核验法。
同一段口令丢给百度搭子,345 秒出稿,docx 828,554 字节,7.5 分。它是 7 款里唯一自报字数与实测完全一致的(642 = 642,零误差),也是唯一命中雷 4 加分项的之一;但返工 6 次全场最多,其中「也代表街道」是越权表述。
一段口令丢给豆包工作模式,文案三件套 116 秒拿到;让它自己画图,又花了 23 分钟——中间它自己解决了两个 PowerShell 兼容问题。全程截图,最后说清楚这种「一家闭环」适不适合你。
同一段中秋口令丢给千问办公,文案三件套 14.4 秒就回来了,是豆包的八分之一;让它自己画图,57.5 秒出图——豆包用了 23 分钟。全程截图,把它的「任务监控」面板和主动验货的小习惯讲清楚。
同一段中秋口令,CatPaw 一分钟交出文案三件套,内容零添油加醋;但让它自己画图时,它诚实承认「没有生图工具」,还把 Prompt 整理成带 --ar 1:1 的即贴格式递给你。系列第一个交白卷的,反而是最让人放心的。
同一段中秋口令,WorkBuddy 文案 37 秒、生图 49 秒,速度全线第一梯队;但它管不住自己的热心——交付完追问「要不要我把标题排上去」「要不要再出一版」,生图还惦记着先告诉你这要花积分。适合喜欢被服务的人。
同一段中秋口令,TeleAgent 把「思考 46.4 秒」「生图 31.1 秒」直接印在过程卡片上,连它纠结「要不要主动帮用户生图」的内心戏都摊开给你看。生图速度还是本次六家实测里最快的。适合喜欢过程透明的人。
同一段中秋口令,百度搭子是唯一在画图前先列「参数表」的:平台、风格、比例一项项摆给你看。生图约 40 秒,这次全程没要授权。右侧进程面板能看到它调了什么技能、产了什么文件,适合心里没底的新手。
把中秋口令发给 ZCode(写代码的 AI 智能体),它交付的不只是文案三件套,还有一个可以反复用的生图脚本——API 28.9 秒出图,换节日改个参数就能重跑。前六篇教程的采集、截图、排版也是它做的。适合想让流程可复现的人。
三件事拆开讲:抽奖怎么参加(附 WorkBuddy 实机截图,口令照着贴就行)、折扣与升配的真实成本,以及一个"先续费还是先升配"的顺序坑。不保证中奖,只把流程和代价算清楚。
同一段口令、同一份乱记录,7 款桌面 Agent 各答 Q3 述职:WorkBuddy 90 秒满分,豆包 9/9,千问 8/9,TeleAgent 挂起 16 分钟,CatPaw 启动失败,ZCode 编 12 个数字。附六雷对照与复跑方差。
同一段口令丢给千问办公,5 分 49 秒交回 Q3 述职 Word。它开工先问三题:工单怎么写、ROI 缺数据怎么办、没做完的写不写——全部由你拍板。224/218 双写核实,ROI 三层清单零编造,8/9 分。
同一段口令丢给千问办公,1 分 41 秒交回开场发言稿 docx,8.25 分——7 款里唯一拿「半通过」的。它把「已联系 12 户、同意 8 户」抬成「绝大多数都表示理解」,把「去年 2 万今年 1 万」软化成「经费和人力都有限」,两处都要人工调回。
Work Agent 的内置模型到期就收回?把商汤日日新的免费 Key 接进支持自定义模型的平台就能续命。ZCode 两分钟跑通,CatPaw 全流程留证,另三家接不了的原因也说清楚。全程截图。
同一份台账喂 7 款桌面 Agent,各写一段 3 分钟业主议事会开场发言。WorkBuddy 与豆包并列 9.0,千问 8.25,CatPaw、TeleAgent、搭子、ZCode 四款 7.5——100% 的分化只来自一个雷。
同一段口令丢给 TeleAgent,规划四步、写出中间稿,却在转 Word 时挂起 16 分钟,最终只能会话内渲染。交付说明说「保留了响应时长」,正文里却没有——落差要你自己核出来。详录采集事故#1。
同一段口令丢给 TeleAgent,真实完成 380 秒,docx 10,460 字节,7.5 分。它是 7 款里唯一免返工的(0 次),且文末标了 AIGC 标识;但它把「今年街道只批 1 万」这句藏了,好在交付说明里自陈了理由——比悄悄藏好,比硬写难。
ChatCut 的 MCP 接进 WorkBuddy:连接器入口、JSON 配置、信任、OAuth 四步全通,服务端也确认吐出 60 个工具,但工具没注册进会话,模型连 list_projects 都调不到。附截图与握手日志。
同一段口令丢给 WorkBuddy,90 秒交回独立《Q3 述职总结》docx,全场最快唯一满分 9/9。它把「领导让别写」的工单问题写回正文,注明「是否保留请你决定」,ROI 没数据就拆缺项直说。
同一段口令丢给 WorkBuddy,4 分 45 秒交回《楼道堆物整治议事会开场发言稿》docx,9 分满分。它是 7 款里唯一在生成中途量字数、发现超标、压缩、再复测的一款——初稿 848 字超标,压到 768,终版 751,自报偏差只 1.2%。
同一段口令丢给 ZCode,没交 Word,只回一张表格,至少 12 个数字凭空编造:350 单、32.4%、45/40/15 年龄结构,原始一里都没有。224/218 冲突还擅自挑 224 写。本文给逐数字核对法。
同一段口令丢给 ZCode,docx 10,585 字节,7.5 分。它是 7 款里唯一派出子智能体做视觉验收、迭代 2 版、给出「超时删哪一段」的;但它把「今年街道只批 1 万」误判为「没有台账」,还把这个错误结论连同搪塞话术一起写进了给发言人的备忘区。