iaiops-fab — 半导体/显示 fab edition(SECS/GEM + OPC-UA + 脑)
启动:IAIOPS_MCP=fab / iaiops-mcp-fab(暴露 secsgem + opcua + s7 + modbus + 脑)。
安装:pip install iaiops[fab]。我们是 HOST(HSMS ACTIVE),设备是 equipment。
Fab 分层认知:一台 fab 设备是两层 —— MES-facing 的 SECS/GEM(HSMS) 接口,与 设备内部控制(PLC,走 OPC-UA/S7/Modbus)。职责不同,别混。S7/Modbus 工具清单见 iaiops-factory skill(fab profile 已同时暴露)。
工具
SECS/GEM(只读;设备 ↔ MES 标准,fab 入场券)
secsgem_equipment_status— 建立 GEM 链路 + Are-You-There(S1F1/F2)secsgem_list_status_variables— SVID namelist(S1F11/F12)secsgem_read_status_variables— SVID 值(S1F3/F4)secsgem_list_equipment_constants— ECID namelist(S2F29/F30)secsgem_read_equipment_constants— ECID 值(S2F13/F14)secsgem_list_alarms— 告警表(S5F5/F6):ALID、ALCD、textsecsgem_list_process_programs— PPID 目录(S7F19/F20)
OPC-UA(只读;设备内控层 / opc.tcp 端点)
opcua_server_info/opcua_browse/opcua_read_node/opcua_read_manyopcua_subscribe_sample— 有界采样后返回(绝不死循环)opcua_read_alarms— best-effort 活动告警/condition(untimed);opcua_alarm_events— A&C 事件订阅(带服务器时间戳)opcua_read_history— HDA 历史读取([start,end] 窗口)opcua_diagnose_connection— 连不上时归因(证书/安全策略/认证/防火墙/DNS/端口/配置)opcua_discover_tags— 自动发现 tag 并建语义资产模型opcua_health_summary— tag vs 阈值分类;opcua_anomaly_scan— 有界统计异常扫描
Fab / 质量专属(edition 工具;仅随 fab edition 加载,不进全局脑)
spc_check— 统计过程控制:对一段量测序列套用 Western Electric / Nelson 控制图规则 (越 3σ、2/3 越 2σ、4/5 越 1σ、连续 8 点单侧、6 点趋势),逐条按点索引报违规;给 USL/LSL 则附 Cp/Cpk。判 in_control / out_of_control。纯分析,每违规引用触发点索引。defect_pareto— 缺陷帕累托:按缺陷类别计数排序,算各类占比与累计占比,标出到 80% 线的 关键少数(遏制/改善最有杠杆的类别)。纯分析,喂检验/缺陷记录,每占比引用计数。
跨协议脑(永远随 server 暴露)
- 诊断:
diagnose_dataflowdowntime_root_causedowntime_root_cause_livedowntime_triagelearn_cause_weightsrca_corpus_from_maintenancehistorian_healthalarm_bad_actorstag_healthsubscription_healthheartbeat_healthalarm_flood_analysisalarm_cascadealarm_rationalization_worksheet - 告警事件聚类:
alarm_event_clusters—alarm_bad_actors按来源排名,回答的是「哪台仪表最吵」, 不是「哪个故障最吵」;一个把同一条件写成十种说法的厂会得到十个 bad actor。这个按事件说了什么分组。 合并规则是去掉大小写/标点/数字后的精确相等,不是相似度 —— 故意做笨,所以不需要模型、且可核对; 每个簇都列出被合并的原文与来源。它不主张两条措辞不同的告警是同一个故障,那由人判断。 - 数据质量:
data_quality_scorecarddata_quality_fleet_rollup - 分析:
oee_computedowntime_eventsoee_multidimmonitor_changeshealth_summary(deprecated)anomaly_scan(deprecated) - 上下文基线:
baseline_learn_contextualbaseline_check_in_context—— 一个位号只学一条带, 在它有不止一个「正常」时就是错的(同一台干燥机 recipe A 走 180 °C、B 走 240 °C,一条带横跨两者, 于是两个工况都不可能出错)。上下文由人声明,绝不推断(D16);某个上下文历史太薄就拒学, 不借用别的上下文的样本;读数落在没学过的上下文里报unknown_context,绝不回落到全局带 —— 回落等于把「这个工况从没见过」说成「这个工况正常」。 - 上下游归因:
downtime_attribution—— RCA 只按时间加权,所以一次上游停机会让每台下游设备 各自给出一个自信的本地根因。方向来自声明的产线顺序(D25:产线上共现是必然,拿它挖边等于 制造因果),顺序来自时间戳,两者都要成立;没声明关系就报not_evaluable并给出补法。 - 资产:
asset_inventorycross_protocol_asset_modeladopt_alias_mapdiff_alias_map - 设备公告对照:
device_advisory_check——scan早就在读 vendor/model/firmware,却什么都没做。 这条把它接上,并刻意停在漏洞扫描器会继续往前走的地方:只报「落在公告声明的版本范围内」, 不说「可利用」、不给严重度 —— 可达性与补偿控制决定那件事,而只读扫描看不见它们。 不内置任何 CVE 库(过期却看着像最新的库比没有更糟),由现场挂载文件、离线可用,每条必须带来源。 读不出固件报version_unknown,读得出但排不了序报version_unparsed—— 都不算通过; 公告没提到的设备不出现在结果里,那是「未知」不是「没有」。 - 基线:
baseline_learnbaseline_checkbaseline_record_changebaseline_status(change-log 基线:拒学薄历史、只报持续越带、每次告警必引基线样本 —— 非黑盒异常检测) - 合规/信创:
compliance_mappingcompliance_frameworkscompliance_dengbao_levelscompliance_reportcompliance_evidence_bundlehistorian_pushexport_datahistorian_queryhistorian_coveragestream_publishuns_publishstream_publish_eventrca_narratefleet_statusfleet_incidentspdm_forecasthistorian_pushexport_data - 程序解读:
plc_program_outlineplc_program_xrefplc_program_sectionplc_program_visibility(解读导出的 ST/AWL/L5X 程序,只读文件,强制引用行号) - 程序变更基线:
plc_program_snapshotplc_program_driftplc_program_history— 把「认可的那一版」 的结构记下来(文件 SHA-256 + 每个 block 的结构指纹:声明/调用/分支条件/定时器,不含行号、注释、 block 顺序,所以在文件顶上加一行注释不会把整份程序报成变更),之后问某一次导出动没动。 三个判词咬得很紧:identical只由 SHA-256 相同得出;logic_changed逐 block 指出哪一类变了;changed_outside_extracted_structure= 字节变了而结构指纹全同 —— 多半是注释/排版,但这些 parser 是结构抽取不是文法,所以它不叫「仅文档」,也不构成放行。删历史只在 CLI(iaiops program forget): 删变更控制证据不该离 agent 只有一次调用。存的是 block 名 + 哈希 + 计数,不落声明、源码行和注释。 - 自证:
verify_determinism— 把「拿掉模型、断网、同一份数据重跑、输出逐字节相同」跑出来: 固定数据集过一遍分析层,规范化后取 SHA-256,在本进程跑两遍、再在两个不同 PYTHONHASHSEED 的 全新解释器里各跑一遍(这一臂才抓得到集合/字典迭代顺序渗进结果),全程 socket 抛异常。 给 CSV/验证团队的是一条能写进 IQ/OQ 的测试用例,不是一句形容词。 - 元:
protocols_supported(产品能做什么)·site_readiness(这个站点今天能跑什么、还差什么;零联网) ·onboarding_status(这个站点走到哪一步了、下一条命令是什么;零联网) ·onboarding_config_draft(把已存的 scan 变成 config.yaml 端点草稿 —— 只写连接事实:value: null的字段是扫描没确认的,照抄它的caution,别替人填也别删;tags永远是空的, 点位语义只能人来确认iaiops tags export|apply) - 调查层(§13,八步证据闭环):
investigation_readinessinvestigation_openinvestigation_showinvestigation_list— 「真出事时这个站能走到第几步、每个缺口还差什么」,以及对一个已过去的窗口 逐步走完并留档(不碰设备)。缺口分两种:你没供(给命令) 与 产品供不了。 - 产线关系与机制库:
line_relation_declareline_relations_listmechanism_library_checkmechanism_library_list— 上下游由人声明(D25:线上下游共现是必然,推不出因果); 机制库按 ISO 14224 分 mode/mechanism/cause,可排除、绝不确认, 库里没有这条原因 →nothing_known(不是「无异议」)。
Workflows
- Doctor-first:
protocols_supported看配置 →iaiops doctor探活 →secsgem_equipment_status确认 GEM 链路(S1F1/F2 通了再谈其他)。 - Read-first:SVID/ECID namelist → 值 →
secsgem_list_alarms;PLC 层用 OPC-UA 工具;停机问题直接downtime_root_cause_live(advisory,引用真实信号)。 - MOC 写:本 edition 的 SECS/GEM 与 OPC-UA 工具均只读;fab profile 暴露的写工具
(如
s7_write_db)走统一 MOC:risk=HIGH+ 默认dry_run=True+ 改前值 undo + 具名审批人iaiops approve双确认。未经授权绝不写生产设备。
支持版本矩阵(内部 HLD §8,设计文档不随本仓发布;待核实 不得当既成事实)
| 协议 | 库(pin) | 规范/版本 | 覆盖 | 传输 | 自测 |
|---|---|---|---|---|---|
| SECS/GEM | secsgem>=0.3,<1 |
SECS-II(E5) · GEM(E30) · HSMS(E37/TCP);SECS-I(E4) 待核实 | 面板/半导体设备 ↔ MES(HOST 侧) | HSMS/TCP | ✅ host+equipment 全软件自测;真机 待核实 |
| OPC-UA | asyncua>=2.0,<3 |
OPC UA 1.0x(DA+HA+AC 子集);FX/TSN 在路线 | 任意合规 Server | opc.tcp | ✅ mock+HDA |