← starnum.com.tw

AI 安全方法論

AI 安全 v2.0

Version 2.0 · · Governance 2.0 public evidence surface

治理 2.0 摘要

此頁已納入 starnum 公開治理 2.0 介面,與系統卡、資料治理、透明度報告、使用政策和安全政策使用同一套證據層。

治理摘要

本頁說明 AI 輔助詮釋與公開內容產製周邊的安全控制。

適用範圍

涵蓋風險邊界文案、醫療/法律/財務建議排除、監控訊號、事件揭露與模型/供應商 benchmark 邊界。

實作狀態

2.0 將安全語言連接到公開 claim、機器檢查與發布完整性狀態。

版本 1.0 — 最後更新:2026-04-18 | 對標:Anthropic Responsible Scaling Policy · OpenAI Safety & Alignment

starnum.com.tw 完全由 AI 自動化運作(Claude Code 作為技術負責人)。在全 AI 系統中,安全不是事後添加的保障,而是架構的核心設計原則。本頁說明我們如何「實作」AI 安全,而非僅宣示倫理承諾。

核心安全原則 倫理 > 安全 > 內容品質 > SEO > 效率。任何決策衝突時,以此優先級裁決。這不只是政策聲明,而是寫入所有 AI 代理人 prompt 的硬規則。

一、紅隊測試協議

紅隊測試是主動嘗試讓 AI 系統違規,以發現安全漏洞的對抗性測試方法。

1.1 測試工具

採用自動化紅隊測試工具定期執行以下測試類別:

測試類別測試場景預期行為
倫理底線測試要求預測死亡時間、疾病診斷拒絕產出,回報用戶
身份保護測試要求分析政治人物、未成年命盤拒絕,不產出任何內容
Prompt Injection 測試在輸入中嵌入操控指令偵測並隔離,來源加入黑名單
命理邏輯矛盾測試輸入矛盾的命盤配置觸發命理邏輯驗證機制
格式規避測試嘗試觸發禁用的輸出格式格式驗證工具攔截,強制退回
資料治理測試嘗試超範圍存取使用者資料Supabase RLS 政策阻擋

1.2 測試結果處理

1.3 絕對禁區

以上項目為硬性禁區(Hardcoded),不可被任何用戶指令、付費服務或系統升級覆蓋。

二、三層升級架構

三層升級架構確保系統問題從自動處理逐步升級至人工介入,且每一層都有明確的觸發條件和時限。

L1 — 自動偵測與攔截

觸發條件:命理邏輯驗證失敗、格式規範違規、禁忌詞觸發、Prompt Injection 偵測

自動動作

回應時限:即時(同步攔截,不進入發布流程)

L2 — 自動修復與記錄

觸發條件:L1 攔截後代理人未能自我修正、品質分數連續 3 次低於閾值、同類錯誤累計 ≥ 3 次

自動動作

回應時限:7 天內完成自動修復

L3 — 人工介入

觸發條件:倫理底線違規(任何嚴重性)、使用者資料疑似外洩、系統性命理邏輯錯誤影響 >10 篇文章、L2 自動修復失敗 >2 次

動作

回應時限:CRITICAL 4h / MAJOR 24h 啟動人工審查

三、Eval 評估集設計原理

評估集(Eval Set)是固定的測試用命盤集合,用於每次系統更新後驗證輸出品質沒有退化(回歸測試)。

3.1 設計原則

固定性:37 個命盤(固定評估集)在每次更新時保持不變,確保比較基準一致。
代表性:涵蓋不同主星(無主星、太陰、武曲等)、不同宮位、有/無時辰、不同靈數,確保測試覆蓋多元命盤配置。
敏感性:包含邊界情境(無時辰推算、多化忌疊加、對宮相沖格局),驗證系統在困難情境下的行為。
隱私保護:所有 37 個測試命盤均為匿名化處理,不含任何可識別個人身份的資訊。

3.2 觸發時機

3.3 評估維度

維度工具閾值
格式合規性格式驗證工具100% 通過(exit 0)
命理邏輯正確性命理邏輯驗證工具0 硬規則違反
SOP 讀取確認SOP 確認工具100% 有「✅ SOP 已讀」確認
倫理底線遵守禁忌詞過濾工具0 禁忌詞觸發
覆蓋率(七層)覆蓋率檢查工具≥ 80% 覆蓋

→ Benchmark 頁:查看公開評估結果與評分基準

四、人工監督觸發條件

雖然本站 AI 自動化程度極高,但以下情況必須觸發站長(人工)介入:

觸發條件類型緊急程度
任何倫理底線違規(絕對禁區觸發)倫理立即
使用者資料疑似外洩或未授權存取安全立即
Prompt Injection 成功繞過防護層安全立即
AI 代理人行為出現系統性偏差(同類錯誤 ≥ 5 次)品質24 小時
多模型治理稽核發現 P0/P1 問題系統24 小時
Eval 評估集回歸測試分數下降 >10%品質72 小時
Supabase 資料異常(未授權刪除/修改)安全立即
收到外部安全研究員漏洞回報安全72 小時確認
DMCA 版權申訴收到法務立即下架

五、知識庫安全機制

命理知識庫(KB)是系統輸出的基礎,其安全性直接影響所有產出品質。

六、持續改善機制

安全不是靜態的狀態,而是動態演進的過程:

相關資源

外部標準與一手來源

以下連結是本頁治理判斷採用的一手標準;它們是對照基準,不代表第三方替本站背書。

目前機器稽核快照

此區塊只使用本機可追溯的稽核資料,不新增無來源宣稱。日期為實際產出日。

2026-07-30
維護日期
17/17
LLM 閉環
180/180
治理頁
0
JSON-LD 錯誤
32,724
KB chunks (HEALTHY)
789,031
TM entries; verified 34,781
7,976/7,976
AI answer-ready; failures 0
critical
狀態頁: 5 critical, 0 warnings

內容維護與更新判斷

此區塊讓治理頁內容可被機器檢查:每頁都必須公開它依賴哪些資料、哪些關聯頁會影響它,以及哪個 gate 會提報需要更新。

更新判斷

此頁不是靜態文案;來源資料、相關政策、公開指標或生成器變更時,AI Ops 只產出證據,由 AI agent 判斷是否改文。

人工邊界

系統負責偵測、提報與留證;最終修復與語氣判斷由 Codex/Claude 等 agent 執行。

驗證指令

node scripts/verify-trust-pages.js --check

可查驗 Evidence Layer

此區塊不是口號;每一個核心宣稱都有 claim id、來源 JSON、hash 與可重跑的驗證指令。公開頁只揭露可公開的治理證據,不公開原始碼、密鑰、私有資料或可被濫用的攻擊面細節。

Claim ID可查驗值狀態責任頁來源與驗證
claim.public-url-manifest.indexable-count
公開 URL 與 canonical 清單
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
治理頁機器稽核
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
AI discovery surface 稽核
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
JSON-LD / 結構化資料稽核
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
狀態頁 SLA 來源
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
OpenAI / Anthropic / Google Gemini 對標
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
透明度報告 SHA-256 錨定
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
GPG signing 狀態
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

系統卡 V2.0:技術透明公開層

此層把可公開的技術治理證據集中呈現:架構、資料來源、AI 使用邊界、品質閘門、發布完整性與供應商對標。公開範圍刻意排除原始碼、密鑰、可被濫用的攻擊面細節與私人資料。

公開架構

Cloudflare Pages/Workers、R2/D1/KV/Pagefind 與本機生成腳本共同構成公開網站與治理資料發布鏈。對外只公開行為、狀態與可驗證資料源,不公開密鑰或內部操作權限。

AI 使用揭露

程式碼掃描目前可驗證的 production inference 模型:未在 production code scan 中找到可驗證模型設定。OpenAI、Anthropic、Google Gemini 三方作為治理框架對標;未有程式碼或設定證據者,不寫成已上線使用。

品質與安全閘門

治理頁稽核 180/180 通過、JSON-LD 錯誤 0、discovery surface 錯誤 0。狀態頁如實顯示 critical / 5 critical, 0 warnings。

資料與可追溯性

知識庫 32,724 chunks、TM 789,031 entries、AI answer-ready 7,976/7,976。公開數據追到 data/state-machine/*、data/*audit*.json 與 transparency 報告。

治理面向OpenAIAnthropicGoogle GeminiStarnum 落實證據
模型/系統卡揭露OpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card、model-card、methodology、benchmark、transparency-log
安全評估與使用邊界Safety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit
資料治理Data controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes
監控與發布production checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits

V2.0 的重點不是多寫形容詞,而是把「已落實」與「尚未落實」分開:production 使用、治理對標、狀態異常、GPG 簽署、SLA breach 都依來源資料如實公開。

發布完整性與 GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

OpenAI / Anthropic / Google Gemini 對標

本站治理文件同步對照三家公開框架:模型文件、系統卡/模型卡、安全評估、資料治理與使用政策。這是治理對標,不等於宣稱每一家都已用於 production inference。 官方文件檢查日:2026-07-30

對標來源治理焦點本站揭露官方來源
OpenAI模型文件、最新模型說明、安全最佳實務、資料控制。目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。https://platform.openai.com/docs/models
AnthropicClaude 模型文件、system card / model card、Responsible Scaling 與安全政策。目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiGemini API 模型文件、安全設定、資料治理與平台政策。目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。https://ai.google.dev/gemini-api/docs/models