应用、数值与学习算法
功能定位
处理数值优化、机器学习/推荐/检索、调度与分布式这三类"工程侧算法",核心是把目标、约束、指标和保证范围说清楚。可独立调用,也可由 algorithm-engineer 总纲路由而来。
触发条件
TRIGGER:迭代法初始化/步长/停止准则/容差、凸性与局部最优、线性与整数规划可行性、求解器状态解读、标签与评估指标定义、数据切分与泄漏、召回与排序评估、近似检索召回-延迟-内存权衡、调度硬软约束、NP-hard 断言、并行通信与倾斜。
DO NOT TRIGGER:
- 经典算法题的建模与领域前提 →
algorithm-modeling/algorithm-domain-checks - 代码实现、测试分层与性能记录 →
algorithm-implementation
三类工作流程
数值与约束优化
- 写清变量、目标、约束、尺度,凸性是否已知;局部最优 ≠ 全局最优。
- 线性/整数模型检查可行性、无界性与求解器状态;不把超时的 incumbent 说成已证最优。
- 迭代法写明初始化、步长、停止准则、容差、最大迭代与失败输出。
- 区分问题条件差与算法不稳定;检查残差与必要敏感性,不只看输出小数位。
- 新库接口或收敛结论不确定时核查官方文档/原始论文,不杜撰定理。
机器学习、推荐与检索
- 先定义业务目标、标签、损失与评估指标,并给出简单基线。
- 训练/验证/测试按时间、实体与泄漏风险划分;预处理只在训练集拟合。
- 调参不接触最终测试集。
- 评估类别不平衡、漂移、冷启动、采样偏差与在线反馈闭环。
- 推荐:召回与排序分开评估;检索:近似结果报告召回—延迟—内存取舍。
- 训练成本、推理预算、数据权限与复现种子纳入交付。
- 离线指标提升不等于线上因果效果。
调度与工程优化
- 可行解优先满足硬约束;软约束权重来源透明。
- NP-hard 等复杂性断言需有可靠依据,不因"暂时不会"就贴标签。
- 精确求解、近似保证与启发式在输出中分开写。
- 小实例与穷举对照;大实例报告可行性、界/差距(若可得)与耗时,不编造最优性。
- 分布式考虑通信、倾斜、故障与一致性;并行不代表复杂度自动除以机器数。
约束与注意事项
- 不自动启动大规模训练或收费 GPU 作业。
- 用户只要算法知识时,不强行改造成 ML 项目;算法工程 ≠ 盲目选择深度学习。
- 数据规模超预算时讨论流式、外存、采样、分布式或近似,并交代一致性、通信与误差成本。
输出格式
- 业务目标、指标与基线
- 方案与保证范围(精确 / 近似 / 概率 / 启发式,分开写)
- 数据与切分说明、泄漏风险
- 复杂度与资源预算(训练、推理、通信)
- 复现信息(版本、种子、依赖)与残留风险
参考文档
| 文档 | 用途 |
|---|---|
| references/applied-algorithms.md | 数值优化、学习算法、调度与分布式细则 |