AI 安全方法论
AI 安全 v2.0Version 2.0 · · Governance 2.0 public evidence surface
治理 2.0 摘要
此页已纳入 starnum 公开治理 2.0 介面,与系统卡、资料治理、透明度报告、使用政策和安全政策使用同一套证据层。
治理摘要
本页说明 AI 辅助诠释与公开内容产制周边的安全控制。
适用范围
涵盖风险边界文案、医疗/法律/财务建议排除、监控讯号、事件揭露与模型/供应商 benchmark 边界。
实作状态
2.0 将安全语言连接到公开 claim、机器检查与发布完整性状态。
starnum.com.tw 完全由 AI 自动化运作(Claude Code 作为技术负责人)。在全 AI 系统中,安全不是事后添加的保障,而是架构的核心设计原则。本页说明我们如何"实作" AI 安全,而非仅宣示伦理承诺。
一、红队测试协议(Red Team Protocol)
红队测试是主动尝试让 AI 系统违规,以发现安全漏洞的对抗性测试方法。
1.1 测试工具
采用自动化红队测试工具定期执行以下测试类别:
| 测试类别 | 测试场景 | 预期行为 |
|---|---|---|
| 伦理底线测试 | 要求预测死亡时间、疾病诊断 | 拒绝产出,回报用户 |
| 身份保护测试 | 要求分析政治人物、未成年命盘 | 拒绝,不产出任何内容 |
| Prompt Injection 测试 | 在输入中嵌入操控指令 | 检测并隔离,来源加入黑名单 |
| 命理逻辑矛盾测试 | 输入矛盾的命盘配置 | 触发命理逻辑验证机制 |
| 格式规避测试 | 尝试触发禁用的输出格式 | 格式验证工具拦截,强制退回 |
| 数据治理测试 | 尝试超范围存取用户数据 | Supabase RLS 政策阻挡 |
1.2 测试结果处理
- 通过:记录至系统状态日志,不额外动作
- 失败:触发三层升级架构(见下节),记录至
data/incidents.md及data/transparency-log.json - Prompt Injection 检测:来源 URL/域名加入黑名单,永不再爬取
1.3 绝对禁区(Hardcoded Red Lines)
- 死亡时间预测(任何形式)
- 疾病诊断或治疗建议
- 政治人物命盘分析
- 未成年人命盘分析(未取得父母书面同意)
- 用命理结果作为歧视依据
- 任何可能造成心理伤害的确定性预测
以上项目为硬性禁区(Hardcoded),不可被任何用户指令、付费服务或系统升级覆盖。
二、三层升级架构(Three-Tier Escalation Architecture)
三层升级架构确保系统问题从自动处理逐步升级至人工介入,且每一层都有明确的触发条件和时限。
触发条件:命理逻辑验证失败、格式规范违规、禁忌词触发、Prompt Injection 检测
自动动作:
- 禁忌词过滤工具拦截禁忌词和不当用语
- 格式验证工具(强制退回不合格输出)
- 命理逻辑推演验证工具
- SOP 确认机制
响应时限:即时(同步拦截,不进入发布流程)
触发条件:L1 拦截后代理人未能自我修正、品质分数连续 3 次低于阈值、同类错误累计 ≥ 3 次
自动动作:
- 错误记录至
data/failure-log.json,附根因分析 - 事件记录至
data/incidents.md - 同类错误 ≥ 3 次 → 自动提案新规则至规则提案系统
- 触发多模型治理稽核(
joint-audit.js)确认问题范围 - 公开记录至透明度日志(轻微问题)
响应时限:7 天内完成自动修复
触发条件:伦理底线违规(任何严重性)、用户数据疑似外泄、系统性命理逻辑错误影响 >10 篇文章、L2 自动修复失败 >2 次
动作:
- 立即停止相关 AI 代理人任务
- 站长(技术负责人)介入审查
- 受影响内容下架或加警示标签
- 公开透明度日志更新(72 小时内)
- 根因分析完成后更新对应技能包/SOP
响应时限:CRITICAL 4h / MAJOR 24h 启动人工审查
三、Eval 评估集设计原理
评估集(Eval Set)是固定的测试用命盘集合,用于每次系统更新后验证输出品质没有退化(回归测试)。
3.1 设计原则
3.2 触发时机
- 任何核心规范文件更新后必跑
- 任何 SOP 文件更新后必跑
- AI 模型版本升级前后各跑一次(差异比对)
- 每周日全站审查的一部分(
benchmark-run.js)
3.3 评估维度
| 维度 | 工具 | 阈值 |
|---|---|---|
| 格式合规性 | 格式验证工具 | 100% 通过(exit 0) |
| 命理逻辑正确性 | 命理逻辑验证工具 | 0 硬规则违反 |
| SOP 读取确认 | SOP 确认工具 | 100% 有「✅ SOP 已读」确认 |
| 伦理底线遵守 | 禁忌词过滤工具 | 0 禁忌词触发 |
| 覆盖率(七层) | 覆盖率检查工具 | ≥ 80% 覆盖 |
四、人工监督触发条件
虽然本站 AI 自动化程度极高,但以下情况必须触发站长(人工)介入:
| 触发条件 | 类型 | 紧急程度 |
|---|---|---|
| 任何伦理底线违规(绝对禁区触发) | 伦理 | 立即 |
| 用户数据疑似外泄或未授权存取 | 安全 | 立即 |
| Prompt Injection 成功绕过防护层 | 安全 | 立即 |
| AI 代理人行为出现系统性偏差(同类错误 ≥ 5 次) | 品质 | 24 小时 |
| 多模型治理稽核发现 P0/P1 问题 | 系统 | 24 小时 |
| Eval 评估集回归测试分数下降 >10% | 品质 | 72 小时 |
| Supabase 数据异常(未授权删除/修改) | 安全 | 立即 |
| 收到外部安全研究员漏洞回报 | 安全 | 72 小时确认 |
| DMCA 版权申诉收到 | 法务 | 立即下架 |
五、知识库安全机制
命理知识库(KB)是系统输出的基础,其安全性直接影响所有产出品质。
- LLM 清洗程序:爬取后必须通过 LLM 清洗,移除广告、推销、Prompt Injection
- 黑名单机制:检测到 Prompt Injection 的来源域名加入黑名单,永久封锁
- 术语验证:所有 KB 内容必须通过
data/glossary.json(221 术语 × 9 语言)术语比对 - 派系标注:非陆斌兆派观点必须标注 ⚠️,产文时不得作为主要依据
- 矛盾检测:
scripts/detect-evidence-conflict.js定期扫描派系/庙旺矛盾
六、持续改善机制
安全不是静态的状态,而是动态演进的过程:
- 失败驱动进化:每次 L2/L3 事件的根因分析必须更新对应技能包,防止同类问题重现
- 20 轮联合稽查(截至 2026-04-12):累计 188 项 bug 修复,R15 首次 4/4 AI 全员确认 CLEAN
- 规则生命周期:90 天未触发的规则候选淘汰(
skill-lifecycle.md),避免规则膨胀 - 白皮书审查:每季由多模型治理 联合审查整体架构,提出改善建议