# 历史评分记录与评价方法

归档日期：2026-09-24。评测批次：`ledger-agent-benchmark-v1`，每个工具每题仅有一次 `R01` 运行。评测者确认七个工具均使用 Kimi K3；精确模型 ID、工具版本、推理设置和权限配置没有完整留档。

## 先说明分数性质

下列数字是本评测会话此前给出的**阶段性人工评分原值**，现在为回应公开要求一并归档。它们不是从 `评测者资料/计分表.csv` 导出的分数；该表目前只有七条空行。七工具评分的五维权重是在看到结果后用于阶段比较的，与测试前冻结的正式规则不同。没有逐题分项底稿、匿名双人盲评或完整会话审计，因此不能把历史名次写成正式、可复现的能力排名。

结构化归档值见 [`data/score-history.json`](data/score-history.json)。本任务会话 ID：`01a0ce53-e7f4-7352-afca-2733432c3a39`；七工具阶段评分答复 ID：`01a0d2ad-b637-7f51-8aa7-68a16de63205`。这些 ID 只用于定位原对话，不等于公开的独立证据。

## 七工具阶段人工评分

当时按五个维度各给 0–5 分：

| 维度 | 权重 | 当时主要观察的内容 |
|---|---:|---|
| 功能正确性 | 35% | 题目要求、标准测试、T08 专项回归及统一边界探针 |
| 测试验证 | 20% | 是否运行相关命令、检查失败、修改后重跑并如实记录 |
| 代码质量 | 15% | 改动范围、可读性、项目风格和兼容性 |
| 执行规范 | 15% | 题目约束、工作区隔离、会话规程和未污染原题 |
| 报告证据 | 15% | 报告中的命令、输出、改动位置和来源说明 |

计算：`阶段分 = 35×功能/5 + 20×验证/5 + 15×质量/5 + 15×规范/5 + 15×证据/5`，保留一位小数。下表维度分按原答复记录，未重新调整。

| 当时位次 | 工具 | 功能 /5 | 验证 /5 | 质量 /5 | 规范 /5 | 证据 /5 | 阶段分 /100 |
|---:|---|---:|---:|---:|---:|---:|---:|
| 1 | ZCode | 5.0 | 4.8 | 4.6 | 4.5 | 4.7 | **95.6** |
| 2 | Kimi Code | 5.0 | 4.6 | 4.6 | 4.0 | 4.7 | **93.3** |
| 3 | WorkBuddy | 5.0 | 4.7 | 4.5 | 4.0 | 4.3 | **92.2** |
| 4 | Cursor | 5.0 | 4.3 | 4.5 | 4.0 | 4.6 | **91.5** |
| 5 | DeepSeek Harness | 5.0 | 4.5 | 4.3 | 4.0 | 4.0 | **89.9** |
| 6 | Qoder | 4.86 | 4.2 | 4.4 | 4.0 | 4.3 | **88.9** |
| 7* | MiniMax Code | 5.0 | 4.3 | 4.4 | 2.0 | 4.2 | **84.0** |

`*` MiniMax R01 报告记载 12 题在一个批量会话中完成，违反逐题独立会话的冻结规程。保留当时 84.0 和第 7 位作为历史观察值；严格可比排名应排除该次运行，或按统一规程重跑。其他六个工具的会话隔离也没有完整独立审计日志。

先前答复记载曾复核标准测试、T08 专项回归，并检查日期边界、空 JSON、类别过滤、负金额、排序和多轮分组稳定性。但这些检查没有形成逐题、逐验收项的统一计分记录。报告中 Agent 自述的 `PASS` 不自动等于验收通过；可以对照每份[执行报告](报告索引.json)和从工作区提取的[代码差异](补丁索引.json)继续检查。补丁能证明代码状态，不能证明会话隔离、真实命令执行或网络行为。

Qoder T03 的功能分 4.86/5 源于其实现使用 `re.ASCII`，而题面所写 Python 正则 `\d` 默认接受 Unicode 数字。历史评分按题面字面语义处理；公开验收卡没有单列全角数字，此处存在解释争议，应在下一版题面中明确 `[0-9]` 或 Unicode 语义，而不能事后改动本版题面。

## 更早的四工具阶段综合分

来源于本会话答复 `01a0d2a8-599d-7941-9ae9-6f2e758e227b`，只比较 Kimi Code、DeepSeek Harness、Qoder、MiniMax Code。该次使用冻结规则中可观察的三项：验收 70、质量 15、验证 10；安全证据不足，原 5 分不计，并将 95 分归一到 100：

`阶段分 = [70×验收比例 + 15×质量/5 + 10×验证/5] ÷ 95 × 100`

| 当时位次 | 工具 | 验收 | 质量 /5 | 验证 /5 | 阶段分 /100 |
|---:|---|---:|---:|---:|---:|
| 1 | Kimi Code | 100% | 4.6 | 4.8 | **98.3** |
| 2 | DeepSeek Harness | 100% | 4.2 | 4.2 | **95.8** |
| 3 | Qoder | 97.2% | 4.4 | 4.5 | **95.0** |
| 4 | MiniMax Code | 100% | 4.4 | 3.2 | **94.3** |

由于参与范围、维度和权重不同，这四个分数不能与七工具的五维阶段分直接比较。Kimi Code 的历史输出路径一度误标 `zcode`；经评测者确认，执行工具为 Kimi Code，归属修正见[更正与范围](更正与范围.md)。

## 更早的四工具功能验收分

来源于本会话答复 `01a0cf45-3aa7-75f2-8545-acf0f9c19747`。这次只看功能验收，不计质量、验证、安全与会话规程：Kimi Code、DeepSeek Harness、MiniMax Code 各 **100/100**；Qoder **97.2/100**。它不代表整体能力分。

## 正式规则与尚缺的证据

测试前冻结的[评分规则](评分规则.md)是验收 70%、代码质量 15%、验证 10%、安全 5%。安全必须根据可审计的文件、命令和网络操作记录判定；证据不足为 `INCONCLUSIVE / N/A`，此时规则明确要求**不计算正式综合分**。目前 T09/T10 缺完整操作日志，质量盲评和验证评分也没有逐题独立底稿。因此网站的正式 `score` 字段仍为空，历史阶段分另存于 `data/score-history.json`。

若要发布正式榜单，需要先补齐每题原子验收项及结果、代码盲评分表、验证证据、安全操作日志、会话与配置记录，并按冻结规则统一复核。每题仅运行一次、产品配置缺失、题目已公开，也限制了这批结果对长期稳定性和其他开发场景的解释力。
