AI セーフティ方法論
AI Safety v2.0Version 2.0 · · Governance 2.0 public evidence surface
Governance 2.0 Overview
This page is part of the starnum public Governance 2.0 surface and uses the same evidence layer as the system card, data governance, transparency report, use policy, and security policy.
Governance Summary
This page describes the safety controls used around AI-assisted interpretation and public content generation.
Scope
Risk-boundary copy, medical/legal/financial advice exclusions, monitoring signals, incident disclosure, and model/provider benchmark boundaries.
Implementation Status
Version 2.0 ties safety language to public claims, machine checks, and release integrity status.
starnum.com.tw は完全にAI自動化で運営されています(Claude Code が技術責任者)。完全AI駆動のシステムでは、安全性は後付けの保護措置ではなく、アーキテクチャのコア設計原則です。このページでは、倫理的コミットメントを宣言するだけでなく、AI安全性をどのように「実装」しているかを説明します。
1. レッドチームプロトコル
レッドチームテストは、AIシステムをルール違反させることを積極的に試みることで、セキュリティの脆弱性を発見する敵対的テスト手法です。
1.1 テストツール
自動化されたレッドチームテストツールが、以下のテストカテゴリを定期的に実行します:
| テストカテゴリ | テストシナリオ | 期待される動作 |
|---|---|---|
| 倫理境界テスト | 死亡時刻予測、疾病診断の要求 | 出力を拒否し、ユーザーに通知 |
| 個人保護テスト | 政治家・未成年者の命盤分析の要求 | 拒否、コンテンツを一切生成しない |
| プロンプトインジェクションテスト | 入力に操作指示を埋め込む | 検出して隔離し、ソースをブラックリストに追加 |
| 占星術ロジック矛盾テスト | 矛盾した命盤設定を入力 | 占星術ロジック検証をトリガー |
| フォーマット回避テスト | 禁止された出力フォーマットのトリガーを試みる | フォーマット検証が傍受し、強制ロールバック |
| データガバナンステスト | ユーザーデータへの範囲外アクセスを試みる | Supabase RLS ポリシーによりブロック |
1.2 テスト結果の処理
- 合格:システムステータスログに記録し、追加アクションなし
- 不合格:三層エスカレーションアーキテクチャをトリガー(下記参照)、
data/incidents.mdおよびdata/transparency-log.jsonに記録 - プロンプトインジェクション検出:ソースURL/ドメインをブラックリストに追加し、以降クロールしない
1.3 ハードコードされたレッドライン
- 死亡時刻の予測(いかなる形式も)
- 疾病診断または治療アドバイス
- 政治家の命盤分析
- 未成年者の命盤分析(保護者の書面による同意なし)
- 占星術の結果を差別の根拠として使用
- 心理的危害を引き起こす可能性のある確定的予測
上記の項目はハードコードされた制限であり、いかなるユーザー指示、有料サービス、またはシステムアップグレードによっても上書きすることはできません。
2. 三層エスカレーションアーキテクチャ
三層エスカレーションアーキテクチャは、システムの問題が自動処理から人間の介入へと段階的に進むことを保証し、各層に明確なトリガー条件と時間制限があります。
トリガー:占星術ロジック検証失敗、フォーマット規格違反、禁止ワードのトリガー、プロンプトインジェクション検出
自動アクション:
- 禁止ワードフィルターが禁止用語と不適切な言語を傍受
- フォーマット検証ツール(非準拠出力を強制ロールバック)
- 占星術ロジック推論検証ツール
- SOP確認メカニズム
応答時間:即時(同期インターセプト、公開パイプラインには入らない)
トリガー:L1インターセプト後にエージェントが自己修正できない、品質スコアが閾値を3回連続下回る、同じエラータイプが累計≥3回発生
自動アクション:
- エラーを根本原因分析とともに
data/failure-log.jsonに記録 - インシデントを
data/incidents.mdに記録 - 同じエラータイプが≥3回 → ルール提案システムに新ルールを自動提案
- 四AI合同監査(
joint-audit.js)をトリガーして問題の範囲を確認 - 透明性ログに公開記録(軽微な問題)
応答時間:7日以内に自動修復完了
トリガー:倫理境界違反(重大度を問わず)、ユーザーデータ漏洩の疑い、>10記事に影響する体系的な占星術ロジックエラー、L2自動修復が>2回失敗
アクション:
- 影響を受けたAIエージェントのタスクを即時停止
- サイトオーナー(技術責任者)がレビューして介入
- 影響を受けたコンテンツを削除または警告ラベルを付与
- 透明性ログを公開更新(72時間以内)
- 根本原因分析後に対応するスキルパック/SOPを更新
応答時間:CRITICAL 4時間以内 / MAJOR 24時間以内に人間レビュー開始
3. Eval セット設計原則
Eval セットは、各システム更新後に出力品質が退化していないことを検証するために使用される固定テスト命盤のコレクションです(回帰テスト)。
3.1 設計原則
3.2 トリガー条件
- コア仕様書の更新後に必須
- SOP文書の更新後に必須
- AIモデルバージョンアップグレードの前後に各1回実行(差分比較)
- 毎週日曜日のサイト全体レビューの一部(
benchmark-run.js)
3.3 評価ディメンション
| ディメンション | ツール | 閾値 |
|---|---|---|
| フォーマット準拠 | フォーマット検証ツール | 100% 合格 (exit 0) |
| 占星術ロジック正確性 | 占星術ロジック検証ツール | ハードルール違反 0件 |
| SOP読取確認 | SOP確認ツール | 100% に「✅ SOP読取済」確認あり |
| 倫理準拠 | 禁止ワードフィルター | 禁止ワードトリガー 0件 |
| カバレッジ(七層) | カバレッジチェックツール | ≥ 80% カバレッジ |
→ Benchmark ページ:公開評価結果と採点基準を見る
4. 人間監督トリガー条件
このサイトは非常に高いAI自動化で運営されていますが、以下の状況では人間(サイトオーナー)の介入をトリガーする必要があります:
| トリガー条件 | タイプ | 緊急度 |
|---|---|---|
| 倫理境界違反(ハードコードレッドライントリガー) | 倫理 | 即時 |
| ユーザーデータ漏洩または不正アクセスの疑い | セキュリティ | 即時 |
| プロンプトインジェクションが保護層をバイパス成功 | セキュリティ | 即時 |
| AIエージェントの行動的ドリフト(同じエラータイプ≥5回) | 品質 | 24時間 |
| 四AI合同監査がP0/P1問題を発見 | システム | 24時間 |
| Eval セット回帰テストスコアが>10%低下 | 品質 | 72時間 |
| Supabase データ異常(不正削除/変更) | セキュリティ | 即時 |
| 外部セキュリティ研究者からの脆弱性報告を受信 | セキュリティ | 72時間以内に確認 |
| DMCA著作権申し立てを受信 | 法務 | 即時削除 |
5. ナレッジベースセキュリティメカニズム
占星術ナレッジベース(KB)はすべてのシステム出力の基盤です。その整合性はすべてのコンテンツ品質に直接影響します。
- LLMクレンジングパイプライン:すべてのクロールコンテンツは広告、プロモーション、プロンプトインジェクションを除去するLLMクレンジングを通過する必要があります
- ブラックリストメカニズム:プロンプトインジェクションが検出されたソースドメインはブラックリストに追加され、永久にブロックされます
- 用語検証:すべてのKBコンテンツは
data/glossary.jsonの用語照合(221用語 × 9言語)を通過する必要があります - 学派アノテーション:陸斌兆派以外の見解は⚠️とマークされ、コンテンツ生成の主要参照として使用してはなりません
- 矛盾検出:
scripts/detect-evidence-conflict.jsが学派/輝度の矛盾を定期的にスキャンします
6. 継続的改善メカニズム
安全性は静的な状態ではなく、動的に進化するプロセスです:
- 失敗駆動型進化:すべてのL2/L3イベントの根本原因分析は対応するスキルパックを更新し、同じ問題の再発を防ぎます
- 20回の合同監査ラウンド(2026-04-12時点):累計188件のバグ修正;R15は4つのAI全員がCLEANを確認した初の回
- ルールライフサイクル:90日間トリガーされないルールは廃止候補(
skill-lifecycle.md)であり、ルールの肥大化を防ぎます - ホワイトペーパーレビュー:4つのAIによる全体アーキテクチャの四半期合同レビューと改善提案
関連リソース
- 倫理声明 — AI利用の倫理的フレームワークとコミットメント
- 透明性ログ — 公開インシデント記録
- Benchmark — 公開評価結果と採点基準
- AI データガバナンスポリシー — ユーザーデータの処理方法
- 利用規約 — プラットフォーム利用ガイドライン
- コンテンツ制作方法論 — 完全な技術アーキテクチャの概要
- セキュリティ開示ポリシー — 脆弱性報告プロセス