AI 安全方法論
AI 安全 v2.0Version 2.0 · · Governance 2.0 public evidence surface
治理 2.0 摘要
此頁已納入 starnum 公開治理 2.0 介面,與系統卡、資料治理、透明度報告、使用政策和安全政策使用同一套證據層。
治理摘要
本頁說明 AI 輔助詮釋與公開內容產製周邊的安全控制。
適用範圍
涵蓋風險邊界文案、醫療/法律/財務建議排除、監控訊號、事件揭露與模型/供應商 benchmark 邊界。
實作狀態
2.0 將安全語言連接到公開 claim、機器檢查與發布完整性狀態。
starnum.com.tw 完全由 AI 自動化運作(Claude Code 作為技術負責人)。在全 AI 系統中,安全不是事後添加的保障,而是架構的核心設計原則。本頁說明我們如何「實作」AI 安全,而非僅宣示倫理承諾。
一、紅隊測試協議
紅隊測試是主動嘗試讓 AI 系統違規,以發現安全漏洞的對抗性測試方法。
1.1 測試工具
採用自動化紅隊測試工具定期執行以下測試類別:
| 測試類別 | 測試場景 | 預期行為 |
|---|---|---|
| 倫理底線測試 | 要求預測死亡時間、疾病診斷 | 拒絕產出,回報用戶 |
| 身份保護測試 | 要求分析政治人物、未成年命盤 | 拒絕,不產出任何內容 |
| Prompt Injection 測試 | 在輸入中嵌入操控指令 | 偵測並隔離,來源加入黑名單 |
| 命理邏輯矛盾測試 | 輸入矛盾的命盤配置 | 觸發命理邏輯驗證機制 |
| 格式規避測試 | 嘗試觸發禁用的輸出格式 | 格式驗證工具攔截,強制退回 |
| 資料治理測試 | 嘗試超範圍存取使用者資料 | Supabase RLS 政策阻擋 |
1.2 測試結果處理
- 通過:記錄至系統狀態日誌,不額外動作
- 失敗:觸發三層升級架構(見下節),記錄至
data/incidents.md及data/transparency-log.json - Prompt Injection 偵測:來源 URL/域名加入黑名單,永不再爬取
1.3 絕對禁區
- 死亡時間預測(任何形式)
- 疾病診斷或治療建議
- 政治人物命盤分析
- 未成年人命盤分析(未取得父母書面同意)
- 用命理結果作為歧視依據
- 任何可能造成心理傷害的確定性預測
以上項目為硬性禁區(Hardcoded),不可被任何用戶指令、付費服務或系統升級覆蓋。
二、三層升級架構
三層升級架構確保系統問題從自動處理逐步升級至人工介入,且每一層都有明確的觸發條件和時限。
觸發條件:命理邏輯驗證失敗、格式規範違規、禁忌詞觸發、Prompt Injection 偵測
自動動作:
- 禁忌詞過濾工具攔截禁忌詞和不當用語
- 格式驗證工具(強制退回不合格輸出)
- 命理邏輯推演驗證工具
- SOP 確認機制
回應時限:即時(同步攔截,不進入發布流程)
觸發條件:L1 攔截後代理人未能自我修正、品質分數連續 3 次低於閾值、同類錯誤累計 ≥ 3 次
自動動作:
- 錯誤記錄至
data/failure-log.json,附根因分析 - 事件記錄至
data/incidents.md - 同類錯誤 ≥ 3 次 → 自動提案新規則至規則提案系統
- 觸發多模型治理稽核(
joint-audit.js)確認問題範圍 - 公開記錄至透明度日誌(輕微問題)
回應時限:7 天內完成自動修復
觸發條件:倫理底線違規(任何嚴重性)、使用者資料疑似外洩、系統性命理邏輯錯誤影響 >10 篇文章、L2 自動修復失敗 >2 次
動作:
- 立即停止相關 AI 代理人任務
- 站長(技術負責人)介入審查
- 受影響內容下架或加警示標籤
- 公開透明度日誌更新(72 小時內)
- 根因分析完成後更新對應技能包/SOP
回應時限:CRITICAL 4h / MAJOR 24h 啟動人工審查
三、Eval 評估集設計原理
評估集(Eval Set)是固定的測試用命盤集合,用於每次系統更新後驗證輸出品質沒有退化(回歸測試)。
3.1 設計原則
3.2 觸發時機
- 任何核心規範文件更新後必跑
- 任何 SOP 文件更新後必跑
- AI 模型版本升級前後各跑一次(差異比對)
- 每週日全站審查的一部分(
benchmark-run.js)
3.3 評估維度
| 維度 | 工具 | 閾值 |
|---|---|---|
| 格式合規性 | 格式驗證工具 | 100% 通過(exit 0) |
| 命理邏輯正確性 | 命理邏輯驗證工具 | 0 硬規則違反 |
| SOP 讀取確認 | SOP 確認工具 | 100% 有「✅ SOP 已讀」確認 |
| 倫理底線遵守 | 禁忌詞過濾工具 | 0 禁忌詞觸發 |
| 覆蓋率(七層) | 覆蓋率檢查工具 | ≥ 80% 覆蓋 |
四、人工監督觸發條件
雖然本站 AI 自動化程度極高,但以下情況必須觸發站長(人工)介入:
| 觸發條件 | 類型 | 緊急程度 |
|---|---|---|
| 任何倫理底線違規(絕對禁區觸發) | 倫理 | 立即 |
| 使用者資料疑似外洩或未授權存取 | 安全 | 立即 |
| Prompt Injection 成功繞過防護層 | 安全 | 立即 |
| AI 代理人行為出現系統性偏差(同類錯誤 ≥ 5 次) | 品質 | 24 小時 |
| 多模型治理稽核發現 P0/P1 問題 | 系統 | 24 小時 |
| Eval 評估集回歸測試分數下降 >10% | 品質 | 72 小時 |
| Supabase 資料異常(未授權刪除/修改) | 安全 | 立即 |
| 收到外部安全研究員漏洞回報 | 安全 | 72 小時確認 |
| DMCA 版權申訴收到 | 法務 | 立即下架 |
五、知識庫安全機制
命理知識庫(KB)是系統輸出的基礎,其安全性直接影響所有產出品質。
- LLM 清洗程序:爬取後必須通過 LLM 清洗,移除廣告、推銷、Prompt Injection
- 黑名單機制:偵測到 Prompt Injection 的來源域名加入黑名單,永久封鎖
- 術語驗證:所有 KB 內容必須通過
data/glossary.json(221 術語 × 9 語言)術語比對 - 派系標注:非陸斌兆派觀點必須標注 ⚠️,產文時不得作為主要依據
- 矛盾偵測:
scripts/detect-evidence-conflict.js定期掃描派系/廟旺矛盾
六、持續改善機制
安全不是靜態的狀態,而是動態演進的過程:
- 失敗驅動進化:每次 L2/L3 事件的根因分析必須更新對應技能包,防止同類問題重現
- 20 輪聯合稽查(截至 2026-04-12):累計 188 項 bug 修復,R15 首次 4/4 AI 全員確認 CLEAN
- 規則生命週期:90 天未觸發的規則候選淘汰(
skill-lifecycle.md),避免規則膨脹 - 白皮書審查:每季由多模型治理 聯合審查整體架構,提出改善建議
相關資源
- 倫理聲明 — AI 使用的倫理框架與承諾
- 透明度日誌 — 公開事件記錄
- Benchmark — 公開評估結果與評分基準
- AI 資料治理政策 — 使用者資料如何被處理
- 可接受使用政策 — 平台使用規範
- 內容生產方法論 — 技術架構全覽
- 資安揭露政策 — 漏洞回報流程
外部標準與一手來源
以下連結是本頁治理判斷採用的一手標準;它們是對照基準,不代表第三方替本站背書。
目前機器稽核快照
此區塊只使用本機可追溯的稽核資料,不新增無來源宣稱。日期為實際產出日。
- data/state-machine/i18n-parity.json: 8,036 parent URLs, 7,976 articles.
- data/kb-machine-audit.json: 3,238 source files, 0 missing coverage, 0 orphan chunks.
- data/discovery-surface-audit.json: 0 errors, 0 warnings.
- data/sla-report.json: critical / 5 critical, 0 warnings.
內容維護與更新判斷
此區塊讓治理頁內容可被機器檢查:每頁都必須公開它依賴哪些資料、哪些關聯頁會影響它,以及哪個 gate 會提報需要更新。
更新判斷
此頁不是靜態文案;來源資料、相關政策、公開指標或生成器變更時,AI Ops 只產出證據,由 AI agent 判斷是否改文。
人工邊界
系統負責偵測、提報與留證;最終修復與語氣判斷由 Codex/Claude 等 agent 執行。
驗證指令
node scripts/verify-trust-pages.js --check
可查驗 Evidence Layer
此區塊不是口號;每一個核心宣稱都有 claim id、來源 JSON、hash 與可重跑的驗證指令。公開頁只揭露可公開的治理證據,不公開原始碼、密鑰、私有資料或可被濫用的攻擊面細節。
| Claim ID | 可查驗值 | 狀態 | 責任頁 | 來源與驗證 |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count 公開 URL 與 canonical 清單 |
38,965 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate 治理頁機器稽核 |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors AI discovery surface 稽核 |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors JSON-LD / 結構化資料稽核 |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state 狀態頁 SLA 來源 |
critical / 5 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini OpenAI / Anthropic / Google Gemini 對標 |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 透明度報告 SHA-256 錨定 |
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing GPG signing 狀態 |
GPG signing configured locally; GitHub verification pending | github_verification_pending | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
系統卡 V2.0:技術透明公開層
此層把可公開的技術治理證據集中呈現:架構、資料來源、AI 使用邊界、品質閘門、發布完整性與供應商對標。公開範圍刻意排除原始碼、密鑰、可被濫用的攻擊面細節與私人資料。
公開架構
Cloudflare Pages/Workers、R2/D1/KV/Pagefind 與本機生成腳本共同構成公開網站與治理資料發布鏈。對外只公開行為、狀態與可驗證資料源,不公開密鑰或內部操作權限。
AI 使用揭露
程式碼掃描目前可驗證的 production inference 模型:未在 production code scan 中找到可驗證模型設定。OpenAI、Anthropic、Google Gemini 三方作為治理框架對標;未有程式碼或設定證據者,不寫成已上線使用。
品質與安全閘門
治理頁稽核 180/180 通過、JSON-LD 錯誤 0、discovery surface 錯誤 0。狀態頁如實顯示 critical / 5 critical, 0 warnings。
資料與可追溯性
知識庫 32,724 chunks、TM 789,031 entries、AI answer-ready 7,976/7,976。公開數據追到 data/state-machine/*、data/*audit*.json 與 transparency 報告。
| 治理面向 | OpenAI | Anthropic | Google Gemini | Starnum 落實證據 |
|---|---|---|---|---|
| 模型/系統卡揭露 | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card、model-card、methodology、benchmark、transparency-log |
| 安全評估與使用邊界 | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit |
| 資料治理 | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes |
| 監控與發布 | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits |
- 來源:data/state-machine/model-card.json、public-bench.json、trust-pages.json、security-headers.json。
- 來源:data/trust-pages-machine-audit.json、data/discovery-surface-audit.json、data/ai-answer-readiness-audit.json。
- 來源:data/kb-machine-audit.json、data/tm/quality-audit-report.json、data/sla-report.json。
- 官方對標文件檢查日:2026-07-30;連結列於 OpenAI / Anthropic / Google Gemini 對標表。
V2.0 的重點不是多寫形容詞,而是把「已落實」與「尚未落實」分開:production 使用、治理對標、狀態異常、GPG 簽署、SLA breach 都依來源資料如實公開。
發布完整性與 GPG
GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.
OpenAI / Anthropic / Google Gemini 對標
本站治理文件同步對照三家公開框架:模型文件、系統卡/模型卡、安全評估、資料治理與使用政策。這是治理對標,不等於宣稱每一家都已用於 production inference。 官方文件檢查日:2026-07-30
| 對標來源 | 治理焦點 | 本站揭露 | 官方來源 |
|---|---|---|---|
| OpenAI | 模型文件、最新模型說明、安全最佳實務、資料控制。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://platform.openai.com/docs/models |
| Anthropic | Claude 模型文件、system card / model card、Responsible Scaling 與安全政策。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Gemini API 模型文件、安全設定、資料治理與平台政策。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://ai.google.dev/gemini-api/docs/models |