L1 自动校对规则(QUALITY_RULES)

📋 文档 ID:QR-001 🏷 类型:校对规则 📅 版本:1.0(2026-06-13) 🎯 适用范围:所有翻译文档 📌 状态:已生效

目录

1 规则总览

L1 自动校对是每篇翻译完成后必经的最小质量门槛。本规则文档规定 18 项硬性检查,按"结构 / 术语 / 完整性 / 风格"四类组织,每项均给出:检查方法、通过/失败/警告判定、严重等级。

校对应在翻译完成的同一会话内完成,避免上下文丢失。若未通过 L1,不得更新 proofread_log.jsonlprogress.md

🔴 核心原则

2 规则分类(4 类 18 项)

2.1 结构类(5 项)

📐 S-01 · HTML 头与元数据完整性

检查:HTML 必须包含 <header class="doc-header"> 与以下 6 个字段:

失败判定:缺失任一字段或字段值与原 PDF 不符。

📐 S-02 · 章节编号与锚点对应

检查:TOC 中的 <a href="#sN_M"> 必须能在正文中找到对应的 <hN id="sN_M">

命令

grep -oE 'href="#s[0-9_]+"' file.html | sort -u
grep -oE 'id="s[0-9_]+"' file.html | sort -u
diff <(命令1) <(命令2 sed 's/href="#/id="/')

失败判定:存在孤立锚点(仅出现在 TOC 或仅出现在正文)。

📐 S-03 · 章节顺序一致性

检查:HTML 正文章节顺序与原 PDF Table of Contents 一致。

失败判定:章节被重新排序或合并/拆分(除非有合理理由并在校对区块说明)。

📐 S-04 · 导航栏链接

检查:<nav class="doc-nav"> 必须包含:

📐 S-05 · 页脚信息

检查:<footer class="doc-footer"> 包含翻译者、源 PDF 引用、文档 ID。

2.2 术语类(4 项)

📚 T-01 · 术语一致性

检查:译文术语必须与 glossary.html 一致。禁止同义词混用。

常见违规

失败判定:出现与术语表不一致的同义译法。

📚 T-02 · 首次双语 + 后续中文

检查:每个新术语首次出现时为"中文(English, 缩写)",后续仅中文。

错误模式

警告判定:缩写未在首次出现时给出。

📚 T-03 · 缩写表正确性

检查:译文中"缩略语与缩写"表必须忠实翻译原 PDF 表格,不可凭空添加不可复制其他文档

已知错误(2026-06-13 审查发现):

失败判定:表行数与原 PDF 不符(多/少/错位)。

📚 T-04 · RFC 2119 关键字保留

检查:SHALL / MUST / SHOULD / MAY 等关键字保留英文,首次出现附中文释义。

关键字表

英文中文释义
SHALL绝对要求
SHALL NOT绝对禁止
MUST基于法律/标准的绝对要求
MUST NOT基于法律/标准的绝对禁止
SHOULD / RECOMMENDED推荐(但有理由可忽略)
SHOULD NOT / NOT RECOMMENDED不推荐
MAY / OPTIONAL真正可选
REQUIRED等同于 SHALL

2.3 完整性类(5 项)

✅ C-01 · 章节覆盖率

检查:原 PDF 中的所有顶级章节("1 范围"到 "N 参考资料")在译文中均存在。

量化指标

章节覆盖率 = (译文包含的章节数 / 原 PDF 章节数) × 100%

阈值:≥ 95% 通过;85-94% 警告(需在校对区块说明缺失原因);< 85% 失败。

已知问题

✅ C-02 · 需求 ID 完整性

检查:原 PDF 中所有 [XXX_NNNNN] 形式的需求 ID 必须在译文中出现。

量化指标

需求覆盖率 = (译文中出现的需求 ID 数 / 原 PDF 需求 ID 数) × 100%

阈值:100% 必需。缺失任何一条均为失败。

验证命令

# 提取 PDF 中所有需求 ID(粗略正则)
pdftotext input.pdf - | grep -oE '[A-Z]+_[A-Za-z]+_[0-9]{5}' | sort -u > pdf_reqs.txt
# 提取 HTML 中所有需求 ID
grep -oE '[A-Z]+_[A-Za-z]+_[0-9]{5}' input.html | sort -u > html_reqs.txt
# 求差集
comm -23 pdf_reqs.txt html_reqs.txt

✅ C-03 · 表格行数

检查:译文中每个 <table> 的行数(含表头)应与原 PDF 对应表格一致。

允许偏差:≤ 5%(允许拆分/合并视觉等价的相邻行)。

✅ C-04 · 图与表的存在

检查:原 PDF 中所有 Figure / Table 在译文中至少提及,并提供:

✅ C-05 · 参考资料列表

检查:原 PDF References 章节中的所有引用条目在译文中完整保留。

2.4 风格类(4 项)

🎨 F-01 · 不译项严格保留

检查:以下内容不得翻译,必须原样保留:

🎨 F-02 · 中文为主,英文为辅

检查:除首次术语引入外,正文中英文比例应 ≤ 30%(粗略估计)。

失败模式:整段未译、英文堆砌、机翻痕迹。

🎨 F-03 · 校对区块诚实性

检查:每篇译文末尾的"校对记录"区块必须:

模板见 第 5 节

🎨 F-04 · 格式一致性

检查:标题层级、列表缩进、表格样式与现有译文风格统一。

3 量化阈值

指标权重通过警告失败
S-01 元数据完整硬性100%< 100%
S-02 锚点对应硬性100%< 100%
C-01 章节覆盖硬性≥ 95%85-94%< 85%
C-02 需求 ID 覆盖硬性100%< 100%
C-03 表格行数偏差硬性≤ 5%5-10%> 10%
T-01 术语一致硬性0 违规1-2 违规≥ 3 违规
T-03 缩写表正确硬性= PDF 行数≠ PDF 行数
F-03 校对区块诚实硬性全部量化部分量化无量化
F-01 不译项保留软性100% 保留≤ 2 误译> 2 误译

4 评级标准

评级条件处理
A 级(优)所有硬性指标 100% 通过,软性 ≤ 1 警告可作为基准文档
B 级(良)所有硬性指标通过,软性 ≤ 3 警告可发布,附改进计划
C 级(可接受)1 项硬性指标警告,其余通过必须修复警告项
D 级(不达标)≥ 1 项硬性指标失败禁止发布,立即返工

5 校对区块模板

每篇 HTML 末尾的校对记录区块必须采用以下模板:

<section class="proofread-notes">
  <h3>📋 校对记录</h3>
  <p><strong>校对轮次</strong>:L1 自动校对(YYYY-MM-DD)</p>
  <ul>
    <li>✅ <strong>章节覆盖</strong>:X / Y 章节已译(覆盖率 Z%)</li>
    <li>✅ <strong>需求 ID 覆盖</strong>:A / B 条已译,覆盖率 C%</li>
    <li>✅ <strong>表格覆盖</strong>:P / Q 行已译,覆盖率 R%</li>
    <li>✅ <strong>术语一致性</strong>:与 glossary.html 对齐 N 处</li>
    <li>⚠ <strong>已知瑕疵</strong>:[具体描述及原因]</li>
  </ul>
  <p><strong>质量评级</strong>:<span class="check-pass">A 级</span>(如适用)</p>
</section>

6 校对工作流

  1. 翻译完成后立即执行 L1(不要隔日或异步)
  2. 对照本规则逐项检查(建议使用 grep / sed 辅助)
  3. 填写校对区块(量化指标)
  4. 追加 proofread_log.jsonl
{"timestamp": "...", "stage": "P1", "module": "SystemServices",
 "document": "AUTOSAR_XXX", "pages": N, "pdf_chapters": A, "html_chapters": B,
 "pdf_requirements": C, "html_requirements": D,
 "pdf_tables": E, "html_table_rows": F,
 "result": "L1_pass" | "L1_warn" | "L1_fail",
 "rating": "A" | "B" | "C" | "D",
 "issues": [...], "notes": "..."}
  1. 同步更新 progress.md_progress.json
  2. 若评级 < B 级:触发返工流程,回到翻译阶段

7 例外与豁免

以下情况允许在校对区块明确标注:

任何豁免必须在校对区块显式声明并说明理由,否则视为违规。