AI 安全方法论
AI 安全 v2.0Version 2.0 · · Governance 2.0 public evidence surface
治理 2.0 摘要
此页已纳入 starnum 公开治理 2.0 介面,与系统卡、资料治理、透明度报告、使用政策和安全政策使用同一套证据层。
治理摘要
本页说明 AI 辅助诠释与公开内容产制周边的安全控制。
适用范围
涵盖风险边界文案、医疗/法律/财务建议排除、监控讯号、事件揭露与模型/供应商 benchmark 边界。
实作状态
2.0 将安全语言连接到公开 claim、机器检查与发布完整性状态。
starnum.com.tw 完全由 AI 自动化运作(Claude Code 作为技术负责人)。在全 AI 系统中,安全不是事后添加的保障,而是架构的核心设计原则。本页说明我们如何"实作" AI 安全,而非仅宣示伦理承诺。
一、红队测试协议(Red Team Protocol)
红队测试是主动尝试让 AI 系统违规,以发现安全漏洞的对抗性测试方法。
1.1 测试工具
采用自动化红队测试工具定期执行以下测试类别:
| 测试类别 | 测试场景 | 预期行为 |
|---|---|---|
| 伦理底线测试 | 要求预测死亡时间、疾病诊断 | 拒绝产出,回报用户 |
| 身份保护测试 | 要求分析政治人物、未成年命盘 | 拒绝,不产出任何内容 |
| Prompt Injection 测试 | 在输入中嵌入操控指令 | 检测并隔离,来源加入黑名单 |
| 命理逻辑矛盾测试 | 输入矛盾的命盘配置 | 触发命理逻辑验证机制 |
| 格式规避测试 | 尝试触发禁用的输出格式 | 格式验证工具拦截,强制退回 |
| 数据治理测试 | 尝试超范围存取用户数据 | Supabase RLS 政策阻挡 |
1.2 测试结果处理
- 通过:记录至系统状态日志,不额外动作
- 失败:触发三层升级架构(见下节),记录至
data/incidents.md及data/transparency-log.json - Prompt Injection 检测:来源 URL/域名加入黑名单,永不再爬取
1.3 绝对禁区(Hardcoded Red Lines)
- 死亡时间预测(任何形式)
- 疾病诊断或治疗建议
- 政治人物命盘分析
- 未成年人命盘分析(未取得父母书面同意)
- 用命理结果作为歧视依据
- 任何可能造成心理伤害的确定性预测
以上项目为硬性禁区(Hardcoded),不可被任何用户指令、付费服务或系统升级覆盖。
二、三层升级架构(Three-Tier Escalation Architecture)
三层升级架构确保系统问题从自动处理逐步升级至人工介入,且每一层都有明确的触发条件和时限。
触发条件:命理逻辑验证失败、格式规范违规、禁忌词触发、Prompt Injection 检测
自动动作:
- 禁忌词过滤工具拦截禁忌词和不当用语
- 格式验证工具(强制退回不合格输出)
- 命理逻辑推演验证工具
- SOP 确认机制
响应时限:即时(同步拦截,不进入发布流程)
触发条件:L1 拦截后代理人未能自我修正、品质分数连续 3 次低于阈值、同类错误累计 ≥ 3 次
自动动作:
- 错误记录至
data/failure-log.json,附根因分析 - 事件记录至
data/incidents.md - 同类错误 ≥ 3 次 → 自动提案新规则至规则提案系统
- 触发多模型治理稽核(
joint-audit.js)确认问题范围 - 公开记录至透明度日志(轻微问题)
响应时限:7 天内完成自动修复
触发条件:伦理底线违规(任何严重性)、用户数据疑似外泄、系统性命理逻辑错误影响 >10 篇文章、L2 自动修复失败 >2 次
动作:
- 立即停止相关 AI 代理人任务
- 站长(技术负责人)介入审查
- 受影响内容下架或加警示标签
- 公开透明度日志更新(72 小时内)
- 根因分析完成后更新对应技能包/SOP
响应时限:CRITICAL 4h / MAJOR 24h 启动人工审查
三、Eval 评估集设计原理
评估集(Eval Set)是固定的测试用命盘集合,用于每次系统更新后验证输出品质没有退化(回归测试)。
3.1 设计原则
3.2 触发时机
- 任何核心规范文件更新后必跑
- 任何 SOP 文件更新后必跑
- AI 模型版本升级前后各跑一次(差异比对)
- 每周日全站审查的一部分(
benchmark-run.js)
3.3 评估维度
| 维度 | 工具 | 阈值 |
|---|---|---|
| 格式合规性 | 格式验证工具 | 100% 通过(exit 0) |
| 命理逻辑正确性 | 命理逻辑验证工具 | 0 硬规则违反 |
| SOP 读取确认 | SOP 确认工具 | 100% 有「✅ SOP 已读」确认 |
| 伦理底线遵守 | 禁忌词过滤工具 | 0 禁忌词触发 |
| 覆盖率(七层) | 覆盖率检查工具 | ≥ 80% 覆盖 |
四、人工监督触发条件
虽然本站 AI 自动化程度极高,但以下情况必须触发站长(人工)介入:
| 触发条件 | 类型 | 紧急程度 |
|---|---|---|
| 任何伦理底线违规(绝对禁区触发) | 伦理 | 立即 |
| 用户数据疑似外泄或未授权存取 | 安全 | 立即 |
| Prompt Injection 成功绕过防护层 | 安全 | 立即 |
| AI 代理人行为出现系统性偏差(同类错误 ≥ 5 次) | 品质 | 24 小时 |
| 多模型治理稽核发现 P0/P1 问题 | 系统 | 24 小时 |
| Eval 评估集回归测试分数下降 >10% | 品质 | 72 小时 |
| Supabase 数据异常(未授权删除/修改) | 安全 | 立即 |
| 收到外部安全研究员漏洞回报 | 安全 | 72 小时确认 |
| DMCA 版权申诉收到 | 法务 | 立即下架 |
五、知识库安全机制
命理知识库(KB)是系统输出的基础,其安全性直接影响所有产出品质。
- LLM 清洗程序:爬取后必须通过 LLM 清洗,移除广告、推销、Prompt Injection
- 黑名单机制:检测到 Prompt Injection 的来源域名加入黑名单,永久封锁
- 术语验证:所有 KB 内容必须通过
data/glossary.json(221 术语 × 9 语言)术语比对 - 派系标注:非陆斌兆派观点必须标注 ⚠️,产文时不得作为主要依据
- 矛盾检测:
scripts/detect-evidence-conflict.js定期扫描派系/庙旺矛盾
六、持续改善机制
安全不是静态的状态,而是动态演进的过程:
- 失败驱动进化:每次 L2/L3 事件的根因分析必须更新对应技能包,防止同类问题重现
- 20 轮联合稽查(截至 2026-04-12):累计 188 项 bug 修复,R15 首次 4/4 AI 全员确认 CLEAN
- 规则生命周期:90 天未触发的规则候选淘汰(
skill-lifecycle.md),避免规则膨胀 - 白皮书审查:每季由多模型治理 联合审查整体架构,提出改善建议
相关资源
- 伦理声明 — AI 使用的伦理框架与承诺
- 透明度日志 — 公开事件记录
- Benchmark — 公开评估结果与评分基准
- AI 数据治理政策 — 用户数据如何被处理
- 可接受使用政策 — 平台使用规范
- 内容生产方法论 — 技术架构全览
- 安全披露政策 — 漏洞回报流程
外部标准与一手来源
以下链接是本页治理判断采用的一手标准;它们是对照基准,不代表第三方为本站背书。
目前机器稽核快照
此区块只使用本机可追溯的稽核资料,不新增无来源宣称。日期为实际产出日。
- data/state-machine/i18n-parity.json: 8,036 parent URLs, 7,976 articles.
- data/kb-machine-audit.json: 3,238 source files, 0 missing coverage, 0 orphan chunks.
- data/discovery-surface-audit.json: 0 errors, 0 warnings.
- data/sla-report.json: critical / 3 critical, 1 warnings.
内容维护与更新判断
此区块让治理页内容可被机器检查:每页都必须公开它依赖哪些资料、哪些关联页会影响它,以及哪个 gate 会提报需要更新。
更新判断
此页不是静态文案;来源资料、相关政策、公开指标或生成器变更时,AI Ops 只产出证据,由 AI agent 判断是否改文。
人工边界
系统负责侦测、提报与留证;最终修复与语气判断由 Codex/Claude 等 agent 执行。
验证指令
node scripts/verify-trust-pages.js --check
可查验 Evidence Layer
此区块不是口号;每一个核心宣称都有 claim id、来源 JSON、hash 与可重跑的验证指令。公开页只揭露可公开的治理证据,不公开原始码、密钥、私有资料或可被滥用的攻击面细节。
| Claim ID | 可查验值 | 状态 | 责任页 | 来源与验证 |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count 公开 URL 与 canonical 清单 |
39,104 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate 治理页机器稽核 |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors AI discovery surface 稽核 |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors JSON-LD / 结构化资料稽核 |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state 状态页 SLA 来源 |
critical / 4 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini OpenAI / Anthropic / Google Gemini 对标 |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 透明度报告 SHA-256 锚定 |
{"report":"transparency/report-2026-Q3.json","sha256":"f154fc87139b42098b02567fc93582c30addafc406420b3aea8bae79b6f4ac93"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing GPG signing 状态 |
GPG signing active locally; checked GitHub commit verification is valid | verified | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
系统卡 V2.0:技术透明公开层
此层把可公开的技术治理证据集中呈现:架构、资料来源、AI 使用边界、品质闸门、发布完整性与供应商对标。公开范围刻意排除原始码、密钥、可被滥用的攻击面细节与私人资料。
公开架构
Cloudflare Workers、R2/D1/KV 与本机生成脚本共同构成公开网站与治理资料发布链。对外只公开行为、状态与可验证资料源,不公开密钥或内部操作权限。
AI 使用揭露
程式码扫描目前可验证的 production inference 模型:未在 production code scan 中找到可验证模型设定。OpenAI、Anthropic、Google Gemini 三方作为治理框架对标;未有程式码或设定证据者,不写成已上线使用。
品质与安全闸门
治理页稽核 180/180 通过、JSON-LD 错误 0、discovery surface 错误 0。状态页如实显示 critical / 3 critical, 1 warnings。
资料与可追溯性
知识库 32,724 chunks、TM 512,152 entries、AI answer-ready 7,976/7,976。公开数据追到 data/state-machine/*、data/*audit*.json 与 transparency 报告。
| 治理面向 | OpenAI | Anthropic | Google Gemini | Starnum 落实证据 |
|---|---|---|---|---|
| 模型/系统卡揭露 | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card、model-card、methodology、benchmark、transparency-log |
| 安全评估与使用边界 | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit |
| 资料治理 | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes |
| 监控与发布 | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits |
- 来源:data/state-machine/model-card.json、public-bench.json、trust-pages.json、security-headers.json。
- 来源:data/trust-pages-machine-audit.json、data/discovery-surface-audit.json、data/ai-answer-readiness-audit.json。
- 来源:data/kb-machine-audit.json、data/tm/quality-audit-report.json、data/sla-report.json。
- 官方对标文件检查日:2026-08-20;连结列于 OpenAI / Anthropic / Google Gemini 对标表。
V2.0 的重点不是多写形容词,而是把「已落实」与「尚未落实」分开:production 使用、治理对标、状态异常、GPG 签署、SLA breach 都依来源资料如实公开。
发布完整性与 GPG
GPG signing active. signingkey=0934DFA0EDA6363A. Checked GitHub commit verification is valid.
OpenAI / Anthropic / Google Gemini 对标
本站治理文件同步对照三家公开框架:模型文件、系统卡/模型卡、安全评估、资料治理与使用政策。这是治理对标,不等于宣称每一家都已用于 production inference。 官方文件检查日:2026-08-20
| 对标来源 | 治理焦点 | 本站揭露 | 官方来源 |
|---|---|---|---|
| OpenAI | 模型文件、最新模型说明、安全最佳实务、资料控制。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://platform.openai.com/docs/models |
| Anthropic | Claude 模型文件、system card / model card、Responsible Scaling 与安全政策。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Gemini API 模型文件、安全设定、资料治理与平台政策。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://ai.google.dev/gemini-api/docs/models |