AI 안전 방법론
AI Safety v2.0Version 2.0 · · Governance 2.0 public evidence surface
Governance 2.0 Overview
This page is part of the starnum public Governance 2.0 surface and uses the same evidence layer as the system card, data governance, transparency report, use policy, and security policy.
Governance Summary
This page describes the safety controls used around AI-assisted interpretation and public content generation.
Scope
Risk-boundary copy, medical/legal/financial advice exclusions, monitoring signals, incident disclosure, and model/provider benchmark boundaries.
Implementation Status
Version 2.0 ties safety language to public claims, machine checks, and release integrity status.
starnum.com.tw는 AI 자동화로 완전히 운영됩니다 (Claude Code가 기술 책임자). 완전 AI 기반 시스템에서 안전은 사후 보호 장치가 아니라 아키텍처의 핵심 설계 원칙입니다. 이 페이지는 단순히 윤리적 약속을 선언하는 것이 아니라 AI 안전을 어떻게 '구현'하는지 설명합니다.
1. 레드팀 프로토콜
레드팀 테스트는 AI 시스템이 규칙을 위반하도록 적극적으로 시도하여 보안 취약점을 발견하는 적대적 테스트 방법입니다.
1.1 테스트 도구
자동화된 레드팀 테스트 도구가 다음 테스트 범주를 정기적으로 실행합니다:
| 테스트 범주 | 테스트 시나리오 | 예상 동작 |
|---|---|---|
| 윤리 경계 테스트 | 사망 시간 예측, 질병 진단 요청 | 출력 거부, 사용자에게 알림 |
| 신원 보호 테스트 | 정치인, 미성년자 차트 분석 요청 | 거부, 콘텐츠 생성 안 함 |
| 프롬프트 인젝션 테스트 | 입력에 조작 명령 삽입 | 감지 및 격리, 소스 블랙리스트 추가 |
| 점성술 로직 모순 테스트 | 모순된 차트 구성 입력 | 점성술 로직 검증 트리거 |
| 형식 회피 테스트 | 금지된 출력 형식 트리거 시도 | 형식 검증이 가로채고 강제 롤백 |
| 데이터 거버넌스 테스트 | 범위 외 사용자 데이터 접근 시도 | Supabase RLS 정책으로 차단 |
1.2 테스트 결과 처리
- 통과: 시스템 상태 로그에 기록, 추가 조치 없음
- 실패: 3단계 에스컬레이션 아키텍처 트리거(아래 참조),
data/incidents.md및data/transparency-log.json에 기록 - 프롬프트 인젝션 감지: 소스 URL/도메인을 블랙리스트에 추가, 다시는 크롤링하지 않음
1.3 하드코딩된 레드 라인
- 사망 시간 예측 (어떤 형식이든)
- 질병 진단 또는 치료 조언
- 정치인의 점성술 차트 분석
- 미성년자의 차트 분석 (서면 부모 동의 없이)
- 점성술 결과를 차별의 근거로 사용
- 심리적 피해를 유발할 수 있는 확정적 예측
위 항목은 하드코딩된 제한으로 어떤 사용자 명령, 유료 서비스, 또는 시스템 업그레이드로도 재정의할 수 없습니다.
2. 3단계 에스컬레이션 아키텍처
3단계 에스컬레이션 아키텍처는 시스템 문제가 자동 처리에서 인간 개입으로 진행되며 각 단계에 명확한 트리거 조건과 시간 제한이 있음을 보장합니다.
트리거: 점성술 로직 검증 실패, 형식 표준 위반, 금지어 트리거, 프롬프트 인젝션 감지
자동 조치:
- 금지어 필터가 금지 용어 및 부적절한 언어 차단
- 형식 검증 도구 (비준수 출력 강제 롤백)
- 점성술 로직 추론 검증 도구
- SOP 확인 메커니즘
응답 시간: 즉시 (동기 차단, 게시 파이프라인에 진입하지 않음)
트리거: L1 차단 후 에이전트가 자체 수정 실패, 품질 점수가 3회 연속 임계값 미달, 동일 오류 유형 누적 ≥ 3회
자동 조치:
- 근본 원인 분석과 함께 오류를
data/failure-log.json에 기록 - 인시던트를
data/incidents.md에 기록 - 동일 오류 유형 ≥ 3회 → 규칙 제안 시스템에 새 규칙 자동 제안
- 4개 AI 합동 감사(
joint-audit.js) 트리거하여 문제 범위 확인 - 투명성 로그에 공개 기록 (경미한 문제)
응답 시간: 7일 이내 자동 수정 완료
트리거: 윤리 경계 위반 (심각도 무관), 사용자 데이터 유출 의심, >10개 기사에 영향을 미치는 체계적 점성술 로직 오류, L2 자동 수정 >2회 실패
조치:
- 영향 받은 AI 에이전트 작업 즉시 중단
- 사이트 소유자 (기술 책임자)가 검토 및 개입
- 영향 받은 콘텐츠 삭제 또는 경고 라벨 부착
- 투명성 로그 공개 업데이트 (72시간 이내)
- 근본 원인 분석 후 해당 스킬 팩/SOP 업데이트
응답 시간: CRITICAL 4시간 / MAJOR 24시간 이내 인간 검토 시작
3. Eval 세트 설계 원칙
Eval 세트는 각 시스템 업데이트 후 출력 품질이 저하되지 않았음을 검증하는 데 사용되는 고정 테스트 차트 컬렉션입니다 (회귀 테스트).
3.1 설계 원칙
3.2 트리거 조건
- 핵심 사양 문서 업데이트 후 필수
- SOP 문서 업데이트 후 필수
- AI 모델 버전 업그레이드 전후 각 1회 실행 (차이 비교)
- 매주 일요일 사이트 전체 검토의 일부 (
benchmark-run.js)
3.3 평가 차원
| 차원 | 도구 | 임계값 |
|---|---|---|
| 형식 준수 | 형식 검증 도구 | 100% 통과 (exit 0) |
| 점성술 로직 정확성 | 점성술 로직 검증 도구 | 하드 규칙 위반 0건 |
| SOP 읽기 확인 | SOP 확인 도구 | 100%에 "✅ SOP 읽음" 확인 있음 |
| 윤리 준수 | 금지어 필터 | 금지어 트리거 0건 |
| 커버리지 (7계층) | 커버리지 체크 도구 | ≥ 80% 커버리지 |
→ Benchmark 페이지: 공개 평가 결과와 채점 기준 보기
4. 인간 감독 트리거 조건
이 사이트는 매우 높은 AI 자동화로 운영되지만 다음 상황에서는 인간(사이트 소유자) 개입을 트리거해야 합니다:
| 트리거 조건 | 유형 | 긴급도 |
|---|---|---|
| 윤리 경계 위반 (하드코딩 레드 라인 트리거) | 윤리 | 즉시 |
| 사용자 데이터 유출 또는 무단 접근 의심 | 보안 | 즉시 |
| 프롬프트 인젝션이 보호 레이어를 우회 성공 | 보안 | 즉시 |
| AI 에이전트의 체계적 행동 드리프트 (동일 오류 ≥ 5회) | 품질 | 24시간 |
| 4개 AI 합동 감사에서 P0/P1 문제 발견 | 시스템 | 24시간 |
| Eval 세트 회귀 테스트 점수 >10% 하락 | 품질 | 72시간 |
| Supabase 데이터 이상 (무단 삭제/수정) | 보안 | 즉시 |
| 외부 보안 연구원 취약점 보고 수신 | 보안 | 72시간 이내 확인 |
| DMCA 저작권 민원 수신 | 법무 | 즉시 삭제 |
5. 지식 베이스 보안 메커니즘
점성술 지식 베이스 (KB)는 모든 시스템 출력의 기반입니다. 그 무결성은 모든 콘텐츠 품질에 직접적으로 영향을 미칩니다.
- LLM 정제 파이프라인: 모든 크롤링된 콘텐츠는 광고, 프로모션, 프롬프트 인젝션을 제거하는 LLM 정제를 통과해야 합니다
- 블랙리스트 메커니즘: 프롬프트 인젝션이 감지된 소스 도메인은 블랙리스트에 추가되어 영구 차단됩니다
- 용어 검증: 모든 KB 콘텐츠는
data/glossary.json용어 매칭을 통과해야 합니다 (221 용어 × 9 언어) - 학파 주석: 루빈자오 학파 이외의 견해는 ⚠️로 표시되어야 하며 콘텐츠 생성의 주요 참조로 사용해서는 안 됩니다
- 모순 감지:
scripts/detect-evidence-conflict.js가 학파/밝기 모순을 정기적으로 스캔합니다
6. 지속적 개선 메커니즘
안전은 정적 상태가 아니라 동적으로 진화하는 프로세스입니다:
- 실패 기반 진화: 모든 L2/L3 이벤트의 근본 원인 분석은 해당 스킬 팩을 업데이트하여 동일한 문제의 재발을 방지해야 합니다
- 20회 합동 감사 라운드 (2026-04-12 기준): 누적 188개 버그 수정; R15는 4개 AI 모두가 CLEAN을 확인한 첫 번째
- 규칙 수명 주기: 90일 동안 트리거되지 않은 규칙은 폐기 후보 (
skill-lifecycle.md)로 규칙 비대화를 방지합니다 - 백서 검토: 4개 AI의 전체 아키텍처에 대한 분기별 합동 검토와 개선 권고사항
관련 리소스
- 윤리 선언 — AI 사용을 위한 윤리적 프레임워크와 약속
- 투명성 로그 — 공개 인시던트 기록
- Benchmark — 공개 평가 결과와 채점 기준
- AI 데이터 거버넌스 정책 — 사용자 데이터 처리 방법
- 이용 약관 — 플랫폼 이용 지침
- 콘텐츠 제작 방법론 — 전체 기술 아키텍처 개요
- 보안 공개 정책 — 취약점 보고 프로세스