免費公開揭露資料偵察員(Public Disclosure Scout)
核心定位:免費揭露的三種學術角色
- 付費庫的免費替代/補充:沒有 TEJ 授權時的第一線;有 TEJ 時用來補付費庫沒有 或延遲的欄位(重大訊息即時性、非結構化揭露)。
- 事件研究的標準事件源:公司治理/揭露研究的事件(董監改選、股利宣告、 增減資、重大契約、裁罰)幾乎都來自 MOPS 重大訊息。公司「宣布」的日期=事件日, 這是媒體報導或財報數字給不了的。
- 文字資料的原始語料來源:年報 MD&A、法說會逐字稿的原始檔——抓回來後 文字量化交棒 text-analytics-architect。
Step 1|判斷免費源有沒有這筆資料(以台灣為例)
完整源目錄讀 references/taiwan-public-sources.md。快速路由:
| 需求 | 免費官方源 |
|---|---|
| 重大訊息/事件日 | 公開資訊觀測站 MOPS(重大訊息 t05st01) |
| 年報/財報原文 | MOPS(年報/財報公告) |
| 股東會/董監改選 | MOPS(股東會決議、董監事持股) |
| 內部人持股異動 | MOPS(內部人持股、設質) |
| 股價/成交 | TWSE/TPEx 官網(日資料) |
| 裁罰/違規 | 金管會、公平會、環保署裁罰公開資料 |
| 專利 | TIPO 專利檢索 |
| 產業/總體 | 政府開放資料平台 data.gov.tw |
判斷紀律同 tej-data-scout:對不上就標「需確認」+指出去哪查,絕不杜撰某源有某欄位。
Step 2|事件研究就緒度(本 skill 最高價值)
要做事件研究時,把揭露變成乾淨事件檔的三件事:
- 事件日定義:採用「公告日」(揭露當日)為事件日;若研究關心市場預期, 另分「宣布日 vs 生效日」,兩者分開檢驗(呼應 causal-inference-architect)。
- 事件檔格式:標準三欄
ticker, event_date, subject——可直接餵事件研究引擎; 台灣資料注意民國日期轉西元、同日多則揭露的去重與歸併。 - 識別碼對接:MOPS 用股票代號,與 TEJ 面板合併要確認代號一致(上市櫃轉板、 更名、暫停交易的代號變動);跨源用統一編號(統編)最穩。
Step 3|抓取合規與資料品質(紅線)
- 合規先於方法:抓任何官方站台前查該站服務條款與 robots;官方揭露屬公開 資訊可研究用,但禮貌抓取(請求間隔數秒、量小、不打爆站台)是研究倫理也是 自保。政府開放資料多有明確授權(政府資料開放授權條款),優先用。
- 個資:揭露文件含自然人姓名(董監、經理人)時,研究呈現去識別化; 不建個人可識別的彙整檔。
- 品質檢查:官方揭露≠零錯——同一事件多次更正、撤銷公告、補充揭露都有; 事件庫要保留 fetched_at 與原始主旨供回溯,抽樣人工核對。
- 來源標註:論文方法節寫明資料源(MOPS 端點與擷取日期)、事件定義、 去重規則——免費源的可重現性交代要比付費庫更完整(因端點會變)。
- 抓不到時的升級階梯:頁面靠 JS 動態載入、
requests只拿到空殼時,讀references/dynamic-scraping-escalation.md——由輕到重逐級升級(先找背後 API → 官方批次 → 無頭瀏覽器),且合規紅線在任何級別不變:🚫 禁用工具的反偵測/隱身 功能,抓不到就升級到「官方管道/申請/人工」,不是升級到「躲過偵測」。
Step 4|接回家族
- 事件日資料 → causal-inference-architect(事件研究識別策略、市場模型異常報酬)。
- 揭露文字內容 → text-analytics-architect(語調/主題量化)。
- 與 TEJ 面板合併 → multi-source-data-integrator(多源嚴謹結合:統編對接、值調解、來源譜系、三角驗證);識別碼對映細節可先問 tej-variable-mapper。
- 免費源+付費源併用時,方法節要交代兩者的涵蓋差異與合併規則。
紅線
- 不杜撰免費源的欄位或端點;不確定標「需確認」附查法。
- 抓取守合規、守禮貌間隔、守個資去識別;站台禁抓就停,不硬爬。
- 官方揭露有更正與撤銷,事件庫要可回溯;不把「抓一次的快照」當定論。
- 本 skill 偵察「到哪抓、怎麼抓成事件、怎麼對接」;實際建模歸 causal-inference-architect / r-spss-syntax-architect。