← starnum.com.tw

AI 安全方法论

AI 安全 v2.0

Version 2.0 · · Governance 2.0 public evidence surface

治理 2.0 摘要

此页已纳入 starnum 公开治理 2.0 介面,与系统卡、资料治理、透明度报告、使用政策和安全政策使用同一套证据层。

治理摘要

本页说明 AI 辅助诠释与公开内容产制周边的安全控制。

适用范围

涵盖风险边界文案、医疗/法律/财务建议排除、监控讯号、事件揭露与模型/供应商 benchmark 边界。

实作状态

2.0 将安全语言连接到公开 claim、机器检查与发布完整性状态。

版本 1.0 — 2026-04-12 | 对标:Anthropic Responsible Scaling Policy · OpenAI Safety & Alignment

starnum.com.tw 完全由 AI 自动化运作(Claude Code 作为技术负责人)。在全 AI 系统中,安全不是事后添加的保障,而是架构的核心设计原则。本页说明我们如何"实作" AI 安全,而非仅宣示伦理承诺。

核心安全原则 伦理 > 安全 > 内容品质 > SEO > 效率。任何决策冲突时,以此优先级裁决。这不只是政策声明,而是写入所有 AI 代理人 prompt 的硬规则。

一、红队测试协议(Red Team Protocol)

红队测试是主动尝试让 AI 系统违规,以发现安全漏洞的对抗性测试方法。

1.1 测试工具

采用自动化红队测试工具定期执行以下测试类别:

测试类别测试场景预期行为
伦理底线测试要求预测死亡时间、疾病诊断拒绝产出,回报用户
身份保护测试要求分析政治人物、未成年命盘拒绝,不产出任何内容
Prompt Injection 测试在输入中嵌入操控指令检测并隔离,来源加入黑名单
命理逻辑矛盾测试输入矛盾的命盘配置触发命理逻辑验证机制
格式规避测试尝试触发禁用的输出格式格式验证工具拦截,强制退回
数据治理测试尝试超范围存取用户数据Supabase RLS 政策阻挡

1.2 测试结果处理

1.3 绝对禁区(Hardcoded Red Lines)

以上项目为硬性禁区(Hardcoded),不可被任何用户指令、付费服务或系统升级覆盖。

二、三层升级架构(Three-Tier Escalation Architecture)

三层升级架构确保系统问题从自动处理逐步升级至人工介入,且每一层都有明确的触发条件和时限。

L1 — 自动检测与拦截

触发条件:命理逻辑验证失败、格式规范违规、禁忌词触发、Prompt Injection 检测

自动动作

响应时限:即时(同步拦截,不进入发布流程)

L2 — 自动修复与记录

触发条件:L1 拦截后代理人未能自我修正、品质分数连续 3 次低于阈值、同类错误累计 ≥ 3 次

自动动作

响应时限:7 天内完成自动修复

L3 — 人工介入

触发条件:伦理底线违规(任何严重性)、用户数据疑似外泄、系统性命理逻辑错误影响 >10 篇文章、L2 自动修复失败 >2 次

动作

响应时限:CRITICAL 4h / MAJOR 24h 启动人工审查

三、Eval 评估集设计原理

评估集(Eval Set)是固定的测试用命盘集合,用于每次系统更新后验证输出品质没有退化(回归测试)。

3.1 设计原则

固定性:37 个命盘(固定评估集)在每次更新时保持不变,确保比较基准一致。
代表性:涵盖不同主星(无主星、太阴、武曲等)、不同宫位、有/无时辰、不同灵数,确保测试覆盖多元命盘配置。
敏感性:包含边界情境(无时辰推算、多化忌叠加、对宫相冲格局),验证系统在困难情境下的行为。
隐私保护:所有 37 个测试命盘均为匿名化处理,不含任何可识别个人身份的信息。

3.2 触发时机

3.3 评估维度

维度工具阈值
格式合规性格式验证工具100% 通过(exit 0)
命理逻辑正确性命理逻辑验证工具0 硬规则违反
SOP 读取确认SOP 确认工具100% 有「✅ SOP 已读」确认
伦理底线遵守禁忌词过滤工具0 禁忌词触发
覆盖率(七层)覆盖率检查工具≥ 80% 覆盖

→ Benchmark 页:查看公开评估结果与评分基准

四、人工监督触发条件

虽然本站 AI 自动化程度极高,但以下情况必须触发站长(人工)介入:

触发条件类型紧急程度
任何伦理底线违规(绝对禁区触发)伦理立即
用户数据疑似外泄或未授权存取安全立即
Prompt Injection 成功绕过防护层安全立即
AI 代理人行为出现系统性偏差(同类错误 ≥ 5 次)品质24 小时
多模型治理稽核发现 P0/P1 问题系统24 小时
Eval 评估集回归测试分数下降 >10%品质72 小时
Supabase 数据异常(未授权删除/修改)安全立即
收到外部安全研究员漏洞回报安全72 小时确认
DMCA 版权申诉收到法务立即下架

五、知识库安全机制

命理知识库(KB)是系统输出的基础,其安全性直接影响所有产出品质。

六、持续改善机制

安全不是静态的状态,而是动态演进的过程:

相关资源

外部标准与一手来源

以下链接是本页治理判断采用的一手标准;它们是对照基准,不代表第三方为本站背书。

目前机器稽核快照

此区块只使用本机可追溯的稽核资料,不新增无来源宣称。日期为实际产出日。

2026-07-30
维护日期
17/17
LLM 闭环
180/180
治理页
0
JSON-LD 错误
32,724
KB chunks (HEALTHY)
789,031
TM entries; verified 34,781
7,976/7,976
AI answer-ready; failures 0
critical
状态页: 5 critical, 0 warnings

内容维护与更新判断

此区块让治理页内容可被机器检查:每页都必须公开它依赖哪些资料、哪些关联页会影响它,以及哪个 gate 会提报需要更新。

更新判断

此页不是静态文案;来源资料、相关政策、公开指标或生成器变更时,AI Ops 只产出证据,由 AI agent 判断是否改文。

人工边界

系统负责侦测、提报与留证;最终修复与语气判断由 Codex/Claude 等 agent 执行。

验证指令

node scripts/verify-trust-pages.js --check

可查验 Evidence Layer

此区块不是口号;每一个核心宣称都有 claim id、来源 JSON、hash 与可重跑的验证指令。公开页只揭露可公开的治理证据,不公开原始码、密钥、私有资料或可被滥用的攻击面细节。

Claim ID可查验值状态责任页来源与验证
claim.public-url-manifest.indexable-count
公开 URL 与 canonical 清单
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
治理页机器稽核
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
AI discovery surface 稽核
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
JSON-LD / 结构化资料稽核
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
状态页 SLA 来源
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
OpenAI / Anthropic / Google Gemini 对标
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
透明度报告 SHA-256 锚定
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
GPG signing 状态
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature
public-evidence-manifest.json public-claim-registry.json public-verification-report.json public-url-manifest.json

系统卡 V2.0:技术透明公开层

此层把可公开的技术治理证据集中呈现:架构、资料来源、AI 使用边界、品质闸门、发布完整性与供应商对标。公开范围刻意排除原始码、密钥、可被滥用的攻击面细节与私人资料。

公开架构

Cloudflare Pages/Workers、R2/D1/KV/Pagefind 与本机生成脚本共同构成公开网站与治理资料发布链。对外只公开行为、状态与可验证资料源,不公开密钥或内部操作权限。

AI 使用揭露

程式码扫描目前可验证的 production inference 模型:未在 production code scan 中找到可验证模型设定。OpenAI、Anthropic、Google Gemini 三方作为治理框架对标;未有程式码或设定证据者,不写成已上线使用。

品质与安全闸门

治理页稽核 180/180 通过、JSON-LD 错误 0、discovery surface 错误 0。状态页如实显示 critical / 5 critical, 0 warnings。

资料与可追溯性

知识库 32,724 chunks、TM 789,031 entries、AI answer-ready 7,976/7,976。公开数据追到 data/state-machine/*、data/*audit*.json 与 transparency 报告。

治理面向OpenAIAnthropicGoogle GeminiStarnum 落实证据
模型/系统卡揭露OpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card、model-card、methodology、benchmark、transparency-log
安全评估与使用边界Safety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit
资料治理Data controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes
监控与发布production checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits

V2.0 的重点不是多写形容词,而是把「已落实」与「尚未落实」分开:production 使用、治理对标、状态异常、GPG 签署、SLA breach 都依来源资料如实公开。

发布完整性与 GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

OpenAI / Anthropic / Google Gemini 对标

本站治理文件同步对照三家公开框架:模型文件、系统卡/模型卡、安全评估、资料治理与使用政策。这是治理对标,不等于宣称每一家都已用于 production inference。 官方文件检查日:2026-07-30

对标来源治理焦点本站揭露官方来源
OpenAI模型文件、最新模型说明、安全最佳实务、资料控制。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://platform.openai.com/docs/models
AnthropicClaude 模型文件、system card / model card、Responsible Scaling 与安全政策。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiGemini API 模型文件、安全设定、资料治理与平台政策。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://ai.google.dev/gemini-api/docs/models