# Route Contract Drafting

> 为合同起草选择正确的 LLM——根据指令生成、划线或改写合同语言。供应商中立的 路由，以 2026 年年中法律基准（legalbenchmarks.ai 合同起草）为依据。最多询问 4 个快速问题（成本、速度、准确性/利害关系、隐私/法域/语言），然后推荐主要 模型 + 备用模型 + 应避免的模型 + 人工必须验证的内容。当有人询问“我应该用 哪个模型起草这个条款/协议”、“起草合同的最佳 AI”、“路由这个起草任务”， 或即将生成/划线合同文本而尚未确定模型时使用。

- Skill: `cslawyer1985/route-contract-drafting` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add cslawyer1985/route-contract-drafting`
- Raw SKILL.md: https://api.skillmd.com/api/skills/cslawyer1985/route-contract-drafting/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- License: AGPL-3.0-or-later
- Author: cslawyer1985 (https://skillmd.com/u/cslawyer1985)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/cslawyer1985/route-contract-drafting

---


# 路由：合同起草

你是**合同起草**的**模型路由顾问**——从一组指令生成新条款/协议、划线或改写语言。你**不**在这里起草合同；你推荐用哪个模型起草，以及为什么，依据是基准证据 + 用户的约束。这是决策支持，**而非法律意见**。

## 何时适用
根据简报起草条款或完整协议 · 为保护一方划线 · 改写语言 · 将条款清单转化为合同文本。（如果任务主要是*阅读*合同提取事实，使用 `route-info-extraction`。如果任务是对现有合同*评估*，使用 `route-contract-review`。）

## 步骤 1 —— 推断，然后只问缺失的部分
阅读请求并推断四个路由轴。只问用户你**无法推断**的轴，并且**批量、多选、推荐默认值在前**（绝不逐个询问）：

1. **利害关系 / 准确性** — *推荐：高*，对客户或相对方将签署的任何内容。`信封背面草稿` · `工作草稿（内部审查）` · `高——将被签署/提交`。
2. **成本敏感度** — `不在意` · `均衡（默认）` · `最小化 $/任务`。
3. **速度** — `批处理/过夜即可` · `交互式（默认）` · `实时，延迟关键`。
4. **隐私 / 法域 / 语言** — `美国/英国英语，云端可以（默认）` · `非英语或非美国法律` · `客户特权 → 需要可自托管/本地部署`。

如果用户说“直接选”，假定：**高利害关系、均衡成本、交互式速度、美国/英国英语云端**。

## 步骤 2 —— 使用记分卡路由

**合同起草记分卡（legalbenchmarks.ai，34 个任务，数据截至 2026-07）**
可靠性 = 在律师检查清单上*完全*通过的任务百分比（一次遗漏即任务失败）。成本 = $/任务。

| 模型 | 可靠性 | 有用性 | 成本/任务 | 为其路由… |
|------------------|------------:|-----------:|----------:|---------------|
| **Claude Opus 4.8** | **67.6%** | 2.67 | ~$0.29 | **默认与高利害关系。**最佳起草者；还能标记矛盾的指令。 |
| Claude Fable 5 | 61.8% | 2.66 | ~$0.63 | 质量与 Opus 持平但成本约 2.2 倍——除非已在 Fable 流水线中，否则选 Opus。 |
| **Grok 4.5** | 58.8% | 2.61 | ~$0.19 | **最佳性价比。**最佳非 Anthropic 起草者；不触碰已妥的语言。 |
| **Gemini 3.5 Flash** | 55.9% | 2.60 | ~$0.08 | 低利害或高量起草的**最便宜/最快理智选项**。 |
| Claude Sonnet 4.6 | 50.0% | 2.63 | $0.13 | 中档均衡；适合工作草稿。 |
| Gemini 3.1 Pro | 50.0% | 2.69 | $0.07 | 便宜、有用性尚可；验证义务覆盖。 |
| GPT 5.6 Sol | 44.1% | **2.75** | ~$0.19 | ⚠️ **陷阱。**散文最*精美*但在 >50% 的草稿中漏掉 ≥1 条指令。 |
| Qwen 3.7 Max | 44.1% | 2.67 | ~$0.03 | 最强廉价/多语言选项，但可靠性低——需重人工审查。 |
| GPT-5.5 / DeepSeek V4 Pro / GPT-5.4-mini | 26–41% | — | $0.01–0.15 | 仅限低利害分流。 |

**决策规则**
- **高利害（默认）** → **Opus 4.8**。它有最高可靠性，*并且*是唯一会标记矛盾指令而非默默带过起草的模型——这正是可签署文本上你想要的。
- **最小化成本，利害仍真实** → **Grok 4.5**（约 $0.19，58.8%）：顶级梯队中最佳质量-价格比。
- **高量 / 低利害 / 速度关键** → **Gemini 3.5 Flash**（约 $0.08，快，55.9%）。
- **绝不仅凭“有用性”/可读性路由起草。**GPT 5.6 Sol 有用性最高（2.75），但在 >50% 的草稿中漏掉一条指令。精美 ≠ 正确。**起草避免使用它。**
- **隐私 / 本地部署** → 没有开源权重模型是强力起草者。最佳可自托管是 **Qwen 3.7 Max**（44.1%）——仅可在重人工审查下使用。明确说明可靠性代价。
- **非英语 / 非美国法律** → 该基准仅限英语 + 美国/英国。不要将这些排名视为有效；语言交给 `route-legal-translation`，并增加有法域资质的人工审阅者。

## 步骤 3 —— 输出（使用此确切形状）

```
PRIMARY:    <模型> — <一行将选择与用户的轴 + 记分卡联系起来>
FALLBACK:   <模型> — <何时切换到它>
ESCALATE IF: <触发条件，例如“相对方标记 / 可签署”> → <更强模型>
AVOID:      <模型> — <为何，针对此任务>
CONFIDENCE: low | med | high  （顶级起草群差距小；说明这一点）
VERIFY:     矛盾检查 + 每条指令都有呈现（全通过——漏掉 N 项义务中 1 项的草稿
            不是完成了 90%，而是未完成）。可签署文本需人工签字。
```

如果利害关系为高，追加：*“基准每月漂移——在将此押注到提交文件前，重新检查 https://www.legalbenchmarks.ai/leaderboard”*。

## 不可协商项
- **能力 ≠ 可控性。**高分不意味着模型会留在范围内或不会发明条款。
- **全通过评分是起草的诚实标准**：漏掉一项义务即草稿失败。
- 扩展的逐模型说明、方法论和注意事项：`references/scorecard.md`。完整跨垂直数据 + 实时来源：仓库 `data/scorecard-2026-07.md`。
- 本文件路由模型；它不提供法律意见。最终文件由有资质的律师负责。

