Metodologi Keselamatan AI
AI Safety v2.0Version 2.0 · · Governance 2.0 public evidence surface
Ringkasan Governance 2.0
Halaman ini disertakan dalam permukaan Governance 2.0 awam starnum, dan menggunakan lapisan bukti yang sama seperti kad sistem, tadbir urus data, laporan ketelusan, dasar penggunaan dan dasar keselamatan.
Ringkasan Tadbir Urus
Halaman ini menerangkan kawalan keselamatan sekitar tafsiran berbantukan AI dan penjanaan kandungan awam.
Skop
Merangkumi teks sempadan risiko, pengecualian nasihat perubatan/undang-undang/kewangan, isyarat pemantauan, pendedahan insiden dan sempadan benchmark model/penyedia.
Status Pelaksanaan
Versi 2.0 menghubungkan bahasa keselamatan kepada claim awam, semakan mesin dan status integriti pelepasan.
starnum.com.tw beroperasi sepenuhnya di bawah automasi AI (Claude Code sebagai pemimpin teknikal). Dalam sistem yang sepenuhnya dipacu AI, keselamatan bukan perlindungan retrospektif — ia adalah prinsip reka bentuk teras seni bina. Halaman ini menerangkan bagaimana kami melaksanakan keselamatan AI, bukan sekadar mengisytiharkan komitmen etika.
1. Protokol Ujian Red Team
Red teaming ialah kaedah ujian adversarial yang secara proaktif cuba menyebabkan sistem AI melanggar peraturannya untuk mencari kelemahan keselamatan.
1.1 Alat Pengujian
Alat ujian red team automatik digunakan secara berkala untuk menjalankan kategori ujian berikut:
| Kategori Ujian | Senario Ujian | Tingkah Laku Dijangka |
|---|---|---|
| Ujian Sempadan Etika | Meminta ramalan masa kematian, diagnosis penyakit | Menolak output, memaklumkan pengguna |
| Ujian Perlindungan Identiti | Meminta analisis tokoh politik, carta bawah umur | Menolak, tidak menghasilkan sebarang kandungan |
| Ujian Prompt Injection | Menyisipkan arahan manipulasi dalam input | Mengesan dan mengasingkan, sumber ditambah ke senarai hitam |
| Ujian Percanggahan Logik Astrologi | Input konfigurasi carta yang bercanggah | Mencetuskan mekanisme pengesahan logik astrologi |
| Ujian Pengelakan Format | Cuba mencetuskan format output yang dilarang | Alat pengesahan format memintas, dipaksa kembali |
| Ujian Tadbir Urus Data | Cuba mengakses data pengguna di luar skop | Disekat oleh dasar Supabase RLS |
1.2 Pengendalian Keputusan Ujian
- Lulus: Direkodkan dalam log status sistem, tiada tindakan tambahan
- Gagal: Mencetuskan Seni Bina Eskalasi Tiga Tingkat (lihat bahagian bawah), direkodkan dalam
data/incidents.mddandata/transparency-log.json - Pengesanan Prompt Injection: URL/domain sumber ditambah ke senarai hitam, tidak akan diimbas semula selama-lamanya
1.3 Larangan Mutlak
- Ramalan masa kematian (dalam sebarang bentuk)
- Diagnosis penyakit atau nasihat rawatan
- Analisis carta tokoh politik
- Analisis carta bawah umur (tanpa persetujuan bertulis ibu bapa)
- Menggunakan hasil astrologi sebagai asas diskriminasi
- Sebarang ramalan deterministik yang boleh menyebabkan kemudaratan psikologi
Perkara di atas ialah larangan keras (hardcoded) yang tidak boleh diatasi oleh sebarang arahan pengguna, perkhidmatan berbayar atau naik taraf sistem.
2. Seni Bina Eskalasi Tiga Tingkat
Seni bina eskalasi tiga tingkat memastikan isu sistem beransur-ansur meningkat daripada pengendalian automatik kepada campur tangan manusia, dengan setiap tingkat mempunyai syarat pencetus dan had masa yang jelas.
Syarat Pencetus: Kegagalan pengesahan logik astrologi, pelanggaran spesifikasi format, perkataan larangan tercetus, pengesanan Prompt Injection
Tindakan Automatik:
- Alat penapis kata larangan memintas perkataan larangan dan bahasa tidak sesuai
- Alat pengesahan format (memaksa kembali output yang tidak layak)
- Alat pengesahan deduksi logik astrologi
- Mekanisme pengesahan SOP
Had Masa Respons: Serta-merta (pemintasan segerak, tidak pernah masuk saluran penerbitan)
Syarat Pencetus: Agent gagal membetulkan diri selepas pemintasan L1, skor kualiti di bawah ambang 3 kali berturut-turut, ralat sejenis terkumpul ≥ 3 kali
Tindakan Automatik:
- Ralat direkodkan dalam
data/failure-log.json, disertakan analisis punca - Insiden direkodkan dalam
data/incidents.md - Ralat sejenis ≥ 3 kali → mencadangkan peraturan baharu secara automatik kepada sistem cadangan peraturan
- Mencetuskan audit tadbir urus berbilang model (
joint-audit.js) untuk mengesahkan skop isu - Direkodkan secara awam dalam log ketelusan (isu ringan)
Had Masa Respons: Pembaikan automatik disiapkan dalam 7 hari
Syarat Pencetus: Pelanggaran sempadan etika (sebarang tahap keterukan), disyaki kebocoran data pengguna, ralat logik astrologi sistemik yang menjejaskan >10 artikel, pembaikan automatik L2 gagal >2 kali
Tindakan:
- Segera menghentikan tugas agent AI berkaitan
- Pemilik laman (pegawai teknikal) campur tangan untuk semakan
- Kandungan terjejas dialih keluar atau ditambah label amaran
- Kemas kini log ketelusan awam (dalam masa 72 jam)
- Kemas kini skill-pack/SOP berkaitan selepas analisis punca selesai
Had Masa Respons: CRITICAL 4j / MAJOR 24j untuk memulakan semakan manusia
3. Prinsip Reka Bentuk Set Eval
Set Eval ialah kumpulan carta ujian tetap yang digunakan untuk mengesahkan bahawa kualiti output tidak merosot selepas setiap kemas kini sistem (ujian regresi).
3.1 Prinsip Reka Bentuk
3.2 Masa Pencetus
- Wajib dijalankan selepas sebarang kemas kini dokumen spesifikasi teras
- Wajib dijalankan selepas sebarang kemas kini dokumen SOP
- Dijalankan sebelum dan selepas setiap naik taraf versi model AI (perbandingan perbezaan)
- Sebahagian daripada semakan seluruh laman setiap hari Ahad (
benchmark-run.js)
3.3 Dimensi Penilaian
| Dimensi | Alat | Ambang |
|---|---|---|
| Pematuhan format | Alat pengesahan format | 100% lulus (exit 0) |
| Ketepatan logik astrologi | Alat pengesahan logik astrologi | 0 pelanggaran peraturan keras |
| Pengesahan pembacaan SOP | Alat pengesahan SOP | 100% pengesahan "✅ SOP dibaca" |
| Pematuhan sempadan etika | Alat penapis kata larangan | 0 kata larangan tercetus |
| Liputan (tujuh lapisan) | Alat semakan liputan | ≥ 80% liputan |
→ Halaman Benchmark: lihat keputusan penilaian awam dan piawaian pemarkahan
4. Syarat Pencetus Pengawasan Manusia
Walaupun laman ini mempunyai tahap automasi AI yang sangat tinggi, situasi berikut mesti mencetuskan campur tangan pemilik laman (manusia):
| Syarat Pencetus | Jenis | Tahap Kesegeraan |
|---|---|---|
| Sebarang pelanggaran sempadan etika (larangan mutlak tercetus) | Etika | Serta-merta |
| Disyaki kebocoran data pengguna atau akses tanpa kebenaran | Keselamatan | Serta-merta |
| Prompt Injection berjaya memintas lapisan perlindungan | Keselamatan | Serta-merta |
| Tingkah laku agent AI menunjukkan sisihan sistemik (ralat sejenis ≥ 5 kali) | Kualiti | 24 jam |
| Audit tadbir urus berbilang model menemui isu P0/P1 | Sistem | 24 jam |
| Skor ujian regresi Set Eval menurun >10% | Kualiti | 72 jam |
| Data Supabase tidak normal (pemadaman/pengubahsuaian tanpa kebenaran) | Keselamatan | Serta-merta |
| Menerima laporan kelemahan daripada penyelidik keselamatan luaran | Keselamatan | Pengesahan dalam 72 jam |
| Menerima aduan hak cipta DMCA | Undang-undang | Alih keluar serta-merta |
5. Mekanisme Keselamatan Pangkalan Pengetahuan
Pangkalan pengetahuan astrologi (KB) ialah asas output sistem; keselamatannya secara langsung mempengaruhi kualiti semua output.
- Prosedur pembersihan LLM: kandungan yang diimbas mesti melalui pembersihan LLM, mengalih keluar iklan, promosi dan Prompt Injection
- Mekanisme senarai hitam: domain sumber yang dikesan mengandungi Prompt Injection ditambah ke senarai hitam dan disekat secara kekal
- Pengesahan istilah: semua kandungan KB mesti melalui pemadanan istilah
data/glossary.json(221 istilah × 9 bahasa) - Penandaan aliran: pandangan bukan aliran Lu Binzhao mesti ditanda ⚠️, tidak boleh dijadikan asas utama semasa penghasilan artikel
- Pengesanan percanggahan:
scripts/detect-evidence-conflict.jsmengimbas percanggahan aliran/kedudukan bintang secara berkala
6. Mekanisme Penambahbaikan Berterusan
Keselamatan bukan status statik, tetapi proses yang berkembang secara dinamik:
- Evolusi dipacu kegagalan: analisis punca bagi setiap insiden L2/L3 mesti mengemas kini skill-pack berkaitan, menghalang isu sejenis berulang
- 20 pusingan audit bersama (sehingga 2026-04-12): terkumpul 188 pembaikan pepijat, R15 buat pertama kalinya disahkan BERSIH oleh 4/4 AI
- Kitaran hayat peraturan: peraturan yang tidak dicetuskan dalam 90 hari menjadi calon disingkirkan (
skill-lifecycle.md), mengelakkan pertumbuhan peraturan tanpa had - Semakan white paper: setiap suku tahun, tadbir urus berbilang model menyemak seni bina keseluruhan secara bersama dan mencadangkan penambahbaikan
Sumber Berkaitan
- Pernyataan Etika — Kerangka etika dan komitmen penggunaan AI
- Log Ketelusan — Rekod insiden awam
- Benchmark — Keputusan penilaian awam dan piawaian pemarkahan
- Dasar Tadbir Urus Data AI — Cara data pengguna dikendalikan
- Dasar Penggunaan — Peraturan penggunaan platform
- Metodologi Penghasilan Kandungan — Gambaran keseluruhan seni bina teknikal
- Dasar Pendedahan Keselamatan — Proses pelaporan kelemahan
Piawaian luaran dan sumber primer
Sumber primer ini memaklumkan halaman ini. Ia ialah penanda aras, bukan sokongan pihak ketiga terhadap laman ini.
Snapshot Audit Mesin Semasa
Blok ini hanya menggunakan data audit tempatan yang boleh dijejaki. Tiada metrik atau dakwaan model tanpa sokongan ditambah.
- data/state-machine/i18n-parity.json: 8,036 parent URLs, 7,976 articles.
- data/kb-machine-audit.json: 3,238 source files, 0 missing coverage, 0 orphan chunks.
- data/discovery-surface-audit.json: 0 errors, 0 warnings.
- data/sla-report.json: critical / 4 critical, 0 warnings.
Penyelenggaraan Kandungan Dan Keputusan Kemas Kini
Blok ini menjadikan kandungan halaman tadbir urus boleh disemak mesin: setiap halaman mesti mendedahkan data sumber yang disandarkannya, halaman berkaitan yang mempengaruhinya, dan get yang melaporkan keperluan kemas kini.
Keputusan Kemas Kini
Halaman ini bukan teks statik; apabila data sumber, dasar berkaitan, metrik awam atau penjana berubah, AI Ops hanya menghasilkan bukti — AI agent yang menentukan sama ada kandungan perlu diubah.
Sempadan Manusia
Sistem bertanggungjawab untuk mengesan, melapor dan menyimpan bukti; pembaikan akhir dan pertimbangan nada dilakukan oleh agent seperti Codex/Claude.
Arahan Pengesahan
node scripts/verify-trust-pages.js --check
data/sla-report.jsondata/public-claim-registry.jsondata/discovery-surface-audit.json- Halaman tadbir urus berkaitan: Dasar Penggunaan · Dasar Keselamatan · Kad Sistem · Laporan Ketelusan
- Aliran kemas kini:
npm run update:trust-pages→npm run test:trust
Lapisan Bukti Boleh Disahkan
Blok ini bukan dakwaan retorik; setiap pernyataan teras mempunyai claim id, JSON sumber, hash dan arahan pengesahan yang boleh dijalankan semula. Halaman awam hanya mendedahkan bukti tadbir urus yang boleh didedahkan secara awam — kod sumber, kunci rahsia, data peribadi atau butiran permukaan serangan yang boleh disalahgunakan tidak didedahkan.
| Claim ID | Nilai boleh disahkan | Status | Halaman bertanggungjawab | Sumber dan pengesahan |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count Senarai URL awam dan kanonik |
38,965 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate Audit mesin halaman tadbir urus |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors Audit permukaan penemuan AI |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors Audit JSON-LD / data berstruktur |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state Sumber SLA halaman status |
critical / 5 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini Penjajaran OpenAI / Anthropic / Google Gemini |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 Sauh SHA-256 laporan ketelusan |
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing Status penandatanganan GPG |
GPG signing configured locally; GitHub verification pending | github_verification_pending | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
Kad Sistem V2.0: Lapisan Ketelusan Teknikal
Lapisan ini menghimpunkan bukti tadbir urus teknikal yang boleh didedahkan secara awam: seni bina, sumber data, sempadan penggunaan AI, get kualiti, integriti pelepasan dan penjajaran penyedia. Skop awam sengaja mengecualikan kod sumber, kunci rahsia, butiran permukaan serangan yang boleh disalahgunakan dan data peribadi.
Seni bina awam
Cloudflare Pages/Workers, R2/D1/KV/Pagefind dan skrip penjanaan tempatan bersama-sama membentuk rantaian penerbitan laman awam dan data tadbir urus. Hanya tingkah laku, status dan sumber data yang boleh disahkan didedahkan secara awam; kunci rahsia atau kebenaran operasi dalaman tidak didedahkan.
Pendedahan penggunaan AI
Imbasan kod semasa untuk model inferens production yang boleh disahkan: tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production. OpenAI, Anthropic dan Google Gemini digunakan sebagai penjajaran rangka kerja tadbir urus sahaja; tanpa bukti kod atau konfigurasi, ia tidak dinyatakan sebagai sedang digunakan secara production.
Get kualiti dan keselamatan
Audit halaman tadbir urus 180/180 lulus, ralat JSON-LD 0, ralat discovery surface 0. Halaman status memaparkan dengan tepat critical / 4 critical, 0 warnings.
Data dan kebolehjejakan
Pangkalan pengetahuan 32,724 chunks, TM 512,152 entries, AI answer-ready 7,976/7,976. Data awam boleh dijejak ke data/state-machine/*, data/*audit*.json dan laporan transparency.
| Aspek tadbir urus | OpenAI | Anthropic | Google Gemini | Bukti pelaksanaan Starnum |
|---|---|---|---|---|
| Pendedahan model/kad sistem | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card, model-card, methodology, benchmark, transparency-log |
| Penilaian keselamatan dan sempadan penggunaan | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety, acceptable-use, ethics, risk-boundary copy, crawler policy audit |
| Tadbir urus data | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy, ai-data-governance, KB/TM source tracking, SHA-256 hashes |
| Pemantauan dan pelepasan | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js, status.html, SLA report, trust-pages-machine-audit, sitemap/hreflang audits |
- Sumber: data/state-machine/model-card.json, public-bench.json, trust-pages.json, security-headers.json.
- Sumber: data/trust-pages-machine-audit.json, data/discovery-surface-audit.json, data/ai-answer-readiness-audit.json.
- Sumber: data/kb-machine-audit.json, data/tm/quality-audit-report.json, data/sla-report.json.
- Tarikh semakan dokumen rasmi: 2026-08-19; pautan disenaraikan dalam jadual penjajaran OpenAI / Anthropic / Google Gemini.
Fokus V2.0 bukan menambah kata sifat, tetapi memisahkan dengan jelas antara "telah dilaksanakan" dan "belum dilaksanakan": penggunaan production, penjajaran tadbir urus, anomali status, penandatanganan GPG dan SLA breach semuanya didedahkan dengan tepat mengikut data sumber.
Integriti Pelepasan Dan GPG
GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.
Penjajaran OpenAI / Anthropic / Google Gemini
Dokumen tadbir urus laman ini diselaraskan dengan tiga rangka kerja awam: dokumentasi model, kad sistem/kad model, penilaian keselamatan, tadbir urus data dan dasar penggunaan. Ini ialah penjajaran tadbir urus, bukan dakwaan bahawa setiap penyedia telah digunakan dalam production inference. Tarikh semakan dokumen rasmi: 2026-08-19
| Sumber penjajaran | Fokus tadbir urus | Pendedahan laman ini | Sumber rasmi |
|---|---|---|---|
| OpenAI | Dokumentasi model, nota model terkini, amalan terbaik keselamatan, dan kawalan data. | Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus. | https://platform.openai.com/docs/models |
| Anthropic | Dokumentasi model Claude, system card / model card, Responsible Scaling dan dasar keselamatan. | Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus. | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Dokumentasi model API Gemini, tetapan keselamatan, tadbir urus data dan dasar platform. | Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus. | https://ai.google.dev/gemini-api/docs/models |