| | 1 | Linux (Ubuntu/Debian) | ⭐⭐⭐⭐⭐ | | 2 | Linux (RHEL/CentOS) | ⭐⭐⭐⭐ | | 3 | Windows (WSL2) | ⭐⭐ | | 4 | Windows (原生) | ⭐ | | 5 | macOS | ⭐ |
引用研究
- LLM-Pilot (SC24, IBM/ETH): OS context switch/interrupt 对延迟有显著影响
- Evaluating Containerization Overhead in MCP Servers (AIxSE 2025): Linux container overhead 远小于 WSL2
- Optimizing LLM Inference Clusters (2025): Linux kernel tuning 对高并发吞吐影响 20-30%
陷阱 · 模型命名混淆
陷阱:Qwen3.5 是纯文本模型,Qwen3-VL 才是多模态。中间差一个字母(5 vs V),能力天壤之别。
常见错误:用户说"用 Qwen3.5 跑图片"→ Qwen3.5 不支持图片
修复规则:
- 收到多模态需求时,首先确认模型名称是否含 "VL" 后缀
- 如果用户说 Qwen3/3.5/3.6 而没有 VL/Coder 后缀 → 纯文本
- 需要图片能力 → 推荐 Qwen2.5-VL 或 Qwen3-VL 系列
- 参考完整型号辨析:
llm-model-selection→ref/qwen-model-variants.md文言:一字之差,天壤之别。先辨型号,再论部署。
关联
references/anonymous-networks-comparison.md— 类 Tor 匿名网络项目对比llm-model-selection— Qwen 型号辨析、vLLM 多模态部署、显存估算
契约层 · BOUNDARY
边界:技能功能边界。
契约层 · IO_CONTRACT
输入:请求描述、上下文信息。 输出:执行结果、状态反馈。
验证清单 · VERIFICATION
- 多模态需求:已确认模型名称含 "VL" 后缀;无后缀(Qwen3/3.5/3.6)判定为纯文本并拒绝图片任务(LLM-001)
- 需图片能力时已推荐 Qwen2.5-VL 或 Qwen3-VL 系列,而非 Qwen3.5(LLM-002)
- 部署平台按评级选择:优先 Linux (Ubuntu/Debian),避免 Windows 原生与 macOS(LLM-003)
- 高并发推理集群已实施 Linux 内核调优并核实 20-30% 吞吐提升;OS 上下文切换/中断对延迟的影响已评估(LLM-004)
- 容器化/推理结论可追溯到引用研究(LLM-Pilot SC24、AIxSE 2025 容器开销、2025 集群优化),无编造数据(LLM-005)
- 推理/部署操作步骤可重复执行且结果可验证(LLM-006)
- 验证失败已记录原因与修复方案,以 Golden 集合(Input/Output/Error)为单一真理来源
核心原则 · PRINCIPLES
- 准确为先: 所有输出必须经过事实核查,不编造数据
- 证据驱动: 每个结论必须可追溯到具体证据或数据源
- 可复现性: 每一步操作必须可重复,结果可验证
Golden 集合 · GOLDEN SET
- Golden Input: 用户请求 "用 Qwen3-VL 在 Linux (Ubuntu/Debian) 高并发部署推理集群" —— 模型名含 VL 后缀、平台评级 ⭐⭐⭐⭐⭐、触发内核调优的正常路径
- Golden Output: 确认 Qwen3-VL 为多模态型号(LLM-001 通过);选定 Linux (Ubuntu/Debian) 弃用 Windows 原生与 macOS(LLM-003);实施 Linux 内核调优,实测吞吐提升落在 20-30% 区间且对照 2025 集群优化研究可溯源(LLM-004/LLM-005),部署步骤可逐步重放结果一致(LLM-006)
- Golden Error: 用户请求 "用 Qwen3.5 跑图片分类" —— 模型名无 "VL" 后缀 → 判定纯文本,拒绝图片任务(LLM-001),返回含上下文背景与恢复建议的错误信息并推荐 Qwen2.5-VL/Qwen3-VL 系列(LLM-002)
Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。
违反任何原则的输出视为失败。原则优先级:准确 > 证据 > 可复现。
每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。
Llm Inference Os---
Genes (策略基因)
紧凑策略表示。条件→策略。需要深度时参考完整文档。
- [LLM-001] 收到多模态需求时 → 首先确认模型名称是否含 "VL" 后缀,若无则判定为纯文本模型并拒绝图片任务
- [LLM-002] 用户指定 Qwen3/3.5/3.6 等无后缀型号时 → 默认按纯文本能力处理,需图片能力时推荐 Qwen2.5-VL 或 Qwen3-VL 系列
- [LLM-003] 选择 LLM 推理操作系统时 → 优先选择 Linux (Ubuntu/Debian) 以获得最高性能评级,避免使用 Windows 原生或 macOS
- [LLM-004] 优化高并发推理集群时 → 实施 Linux 内核调优以获取 20-30% 的吞吐提升,并关注 OS 上下文切换对延迟的影响
- [LLM-005] 生成任何结论或数据时 → 必须经过事实核查且可追溯到具体证据源,严禁编造数据
- [LLM-006] 执行推理或部署操作时 → 确保每一步操作可重复且结果可验证,以维持系统的可复现性
- [LLM-007] 进行系统验证时 → 必须覆盖输入、过程、输出、边界及错误处理五个维度,且验证失败需记录原因和修复方案
示例 · EXAMPLES
- 输入: 用户要求"用 Qwen3.5 跑图片分类"。操作: 按陷阱修复规则(LLM-001/LLM-002)检查模型名无 "VL" 后缀 → 判定纯文本,拒绝图片任务并推荐 Qwen2.5-VL/Qwen3-VL 系列。验证: VERIFICATION LLM-001 打勾;拒绝理由与推荐型号记录在案(LLM-005 可溯源)。
- 输入: 在 Windows 原生 + macOS 各部署一套 vLLM 推理节点。操作: 按平台评级表与 LLM-003 → 迁移至 Linux (Ubuntu/Debian)(⭐⭐⭐⭐⭐),弃用原生 Windows 与 macOS 节点。验证: LLM-003 通过;迁移步骤按 LLM-006 逐步重放一遍,结果一致。
- 输入: 高并发推理集群吞吐偏低。操作: 按 LLM-004 实施 Linux 内核调优并评估 OS 上下文切换/中断对延迟的影响。验证: 实测吞吐提升落在 20-30% 区间(LLM-005 对照 2025 集群优化研究),数据源记录在案,失败则记原因与修复(LLM-007)。