文件验收与 WORKBUDDY BENCH 实测
严苛任务里,
看见妙爪的实干能力。
整理办公材料、完成交互网页、修复真实代码。这里分别展示 3.3.1 的实际办公验收,以及 3.2.3 的历史 WorkBuddy Bench 题集复现;版本、条件和结果各自说明。
MIAOCLAW 3.3.1 · KIMI K2.7 CODE · 2026 年 9 月 6 日
一份采购材料,接着完成表格、简报与汇报
在同一段对话里整理采购台账、形成复盘简报与演示稿,再继续交付已有文件。检查实际文件和修改后的结果,让办公能力有具体依据。
Excel · 保留数据,核对计算
保留 46 条原始记录与 212 个公式,35 条入选记录逐条核对。用 Excel 打开并重新计算,另在检查副本上做两项修改,确认结果按预期联动。
Word / PPT · 原生打开检查
两页 Word 简报、三页 PPT 汇报逐页检查,讲者备注保留。核对的是模型交出的原文件,维护者没有代改答案。
同会话 · 继续修改和交付
后续明确要求交付三份已有文件后,Excel、Word、PPT 均出现在对话中,刷新后仍可打开,无需为了交付重复制作。
查看验收范围与保留的问题
这是 3.3.1 的维护者实际文件验收,不是 WorkBuddy Bench 新成绩,也不是所有办公任务的成功率。采购任务较早一轮只选择交付了 Excel,后续同会话完成三文件交付。
另一项服务结算任务的首次 PPT 首页存在重叠;在原对话提出自然反馈后,妙爪修复了排版并保留其他页面和备注。首次失败仍保留,模型对修复原因的解释也并非完全准确。
历史 WorkBuddy Bench 题集复现
历史题集测试使用 Kimi K2.7 Code2026 年 9 月 5 日 · Miaoclaw 3.2.3 · 维护者复现
代码修复
固定 8 题选测,6 题满分
同一批补丁,修正评分环境后复核
网页制作
覆盖页面、交互和任务要求
完整 70 题中,21 题取得满分
这份成绩,经过怎样的检验?
看实际交付
题目涉及文件处理、网页交互和代码修复等多步骤工作。评分检查产物与任务要求,不能只靠一段流畅的回答拿分。
细节也计分
网页评分按配置逐项扣分,完成度、功能和细节都影响结果。一项未满足,就可能扣掉相应分值。
关键条件严格把关
网页题若触发致命失败或未满足要求的完成条件,整题可能不得分。分数体现具体验收规则,并非“内容正确的百分比”。
完整测评,有据可查
本次覆盖办公 50 题、网页制作 70 题及代码修复固定 8 题。上方精选展示实测亮点,完整分数与测试条件保留在这里。
展开完整成绩、评分分布与复核说明
题池共 128 道,实际答题 127 道;另有 1 道办公题缺少输入文件,按零分计入总成绩。以下分数均为百分制,各类题目分别计分。
| 任务 | 平均得分 | 结果与条件 |
|---|---|---|
| 办公文档 · 50 题 | 54.9622 | 49 道实际答题;1 道输入缺失计零。仅看已答的 49 道,平均为 56.0839。 |
| 网页制作 · 70 题 | 54.2857 | 21 道满分、30 道部分得分、19 道零分。检验的是网页制作,不是联网搜索准确率。 |
| 代码修复 · 8 题 | 25.0000 原始 84.6154 环境纠错后 | 保留同一批代码补丁,仅修正评分环境,未重新答题。纠错后 6 道满分,1 道通过 10/13 项检查,1 道零分。 |
代码为官方 80 题中的固定 8 题选测,不是全量代码成绩;环境纠错使用原补丁,未重新答题。本次记录为维护者复现,不是官方排行榜,各类均分不合并成综合能力分数。
成绩同时包含实际任务缺陷和评测环境的影响,不能将所有扣分归为“小瑕疵”。以上保留原始分布和复核条件,便于按自己的任务需要判断。
测试怎样进行
妙爪负责答题,评分与答题分开。本次在隔离环境运行,使用 Kimi K2.7 Code;办公与代码采用规则检查,网页按题目配置评分,办公原始材料和交付文件另有人工核对。每题单次尝试,保留原始产物。
模型与条件明确,成绩才有参考价值。查看 Kimi 官方模型说明 ↗
查看评分说明与数据摘要
办公总分保留缺失题,避免只展示可完成的题目。代码同时公开原始分与环境纠错分,避免把评分修正误认为能力提升。各类任务规模和评分方式不同,不合并成一个综合能力分数。
此页记录的是 3.2.3 的历史结果,不是 3.3.1 的新成绩,也不能覆盖长期记忆、联网引用、图片回答等尚需单独检验的能力。
每一轮实测,都让妙爪更进一步
从任务中发现共性问题,用复测检验改进。我们持续打磨文件、网页与代码工作的实际体验,让这位桌面伙伴越来越得力。
返回妙爪首页 →