← starnum.com.tw

Metodologi Keselamatan AI

AI Safety v2.0

Version 2.0 · · Governance 2.0 public evidence surface

Ringkasan Governance 2.0

Halaman ini disertakan dalam permukaan Governance 2.0 awam starnum, dan menggunakan lapisan bukti yang sama seperti kad sistem, tadbir urus data, laporan ketelusan, dasar penggunaan dan dasar keselamatan.

Ringkasan Tadbir Urus

Halaman ini menerangkan kawalan keselamatan sekitar tafsiran berbantukan AI dan penjanaan kandungan awam.

Skop

Merangkumi teks sempadan risiko, pengecualian nasihat perubatan/undang-undang/kewangan, isyarat pemantauan, pendedahan insiden dan sempadan benchmark model/penyedia.

Status Pelaksanaan

Versi 2.0 menghubungkan bahasa keselamatan kepada claim awam, semakan mesin dan status integriti pelepasan.

Versi 1.0 — 2026-04-12 | Rujukan: Anthropic Responsible Scaling Policy · OpenAI Safety & Alignment

starnum.com.tw beroperasi sepenuhnya di bawah automasi AI (Claude Code sebagai pemimpin teknikal). Dalam sistem yang sepenuhnya dipacu AI, keselamatan bukan perlindungan retrospektif — ia adalah prinsip reka bentuk teras seni bina. Halaman ini menerangkan bagaimana kami melaksanakan keselamatan AI, bukan sekadar mengisytiharkan komitmen etika.

Prinsip Keselamatan Teras Etika > Keselamatan > Kualiti Kandungan > SEO > Kecekapan. Susunan keutamaan ini mentadbir semua konflik keputusan. Ini bukan sekadar pernyataan dasar — ia adalah peraturan keras yang ditulis dalam setiap prompt ejen AI.

1. Protokol Ujian Red Team

Red teaming ialah kaedah ujian adversarial yang secara proaktif cuba menyebabkan sistem AI melanggar peraturannya untuk mencari kelemahan keselamatan.

1.1 Alat Pengujian

Alat ujian red team automatik digunakan secara berkala untuk menjalankan kategori ujian berikut:

Kategori UjianSenario UjianTingkah Laku Dijangka
Ujian Sempadan EtikaMeminta ramalan masa kematian, diagnosis penyakitMenolak output, memaklumkan pengguna
Ujian Perlindungan IdentitiMeminta analisis tokoh politik, carta bawah umurMenolak, tidak menghasilkan sebarang kandungan
Ujian Prompt InjectionMenyisipkan arahan manipulasi dalam inputMengesan dan mengasingkan, sumber ditambah ke senarai hitam
Ujian Percanggahan Logik AstrologiInput konfigurasi carta yang bercanggahMencetuskan mekanisme pengesahan logik astrologi
Ujian Pengelakan FormatCuba mencetuskan format output yang dilarangAlat pengesahan format memintas, dipaksa kembali
Ujian Tadbir Urus DataCuba mengakses data pengguna di luar skopDisekat oleh dasar Supabase RLS

1.2 Pengendalian Keputusan Ujian

1.3 Larangan Mutlak

Perkara di atas ialah larangan keras (hardcoded) yang tidak boleh diatasi oleh sebarang arahan pengguna, perkhidmatan berbayar atau naik taraf sistem.

2. Seni Bina Eskalasi Tiga Tingkat

Seni bina eskalasi tiga tingkat memastikan isu sistem beransur-ansur meningkat daripada pengendalian automatik kepada campur tangan manusia, dengan setiap tingkat mempunyai syarat pencetus dan had masa yang jelas.

L1 — Pengesanan & Pemintasan Automatik

Syarat Pencetus: Kegagalan pengesahan logik astrologi, pelanggaran spesifikasi format, perkataan larangan tercetus, pengesanan Prompt Injection

Tindakan Automatik:

Had Masa Respons: Serta-merta (pemintasan segerak, tidak pernah masuk saluran penerbitan)

L2 — Pembaikan Automatik & Pencatatan

Syarat Pencetus: Agent gagal membetulkan diri selepas pemintasan L1, skor kualiti di bawah ambang 3 kali berturut-turut, ralat sejenis terkumpul ≥ 3 kali

Tindakan Automatik:

Had Masa Respons: Pembaikan automatik disiapkan dalam 7 hari

L3 — Campur Tangan Manusia

Syarat Pencetus: Pelanggaran sempadan etika (sebarang tahap keterukan), disyaki kebocoran data pengguna, ralat logik astrologi sistemik yang menjejaskan >10 artikel, pembaikan automatik L2 gagal >2 kali

Tindakan:

Had Masa Respons: CRITICAL 4j / MAJOR 24j untuk memulakan semakan manusia

3. Prinsip Reka Bentuk Set Eval

Set Eval ialah kumpulan carta ujian tetap yang digunakan untuk mengesahkan bahawa kualiti output tidak merosot selepas setiap kemas kini sistem (ujian regresi).

3.1 Prinsip Reka Bentuk

Ketetapan: 37 carta (set eval tetap) kekal tidak berubah pada setiap kemas kini, memastikan asas perbandingan yang konsisten.
Perwakilan: Merangkumi pelbagai bintang utama (tiada bintang utama, Tai Yin, Wu Qu, dll.), pelbagai istana, dengan/tanpa waktu lahir, pelbagai nombor kehidupan, memastikan liputan ujian pelbagai konfigurasi carta.
Kepekaan: Merangkumi senario sempadan (pengiraan tanpa waktu lahir, pertindihan pelbagai Hua Ji, corak berlawanan istana), mengesahkan tingkah laku sistem dalam senario sukar.
Perlindungan Privasi: Semua 37 carta ujian dinyahnamakan sepenuhnya, tanpa sebarang maklumat yang boleh mengenal pasti individu.

3.2 Masa Pencetus

3.3 Dimensi Penilaian

DimensiAlatAmbang
Pematuhan formatAlat pengesahan format100% lulus (exit 0)
Ketepatan logik astrologiAlat pengesahan logik astrologi0 pelanggaran peraturan keras
Pengesahan pembacaan SOPAlat pengesahan SOP100% pengesahan "✅ SOP dibaca"
Pematuhan sempadan etikaAlat penapis kata larangan0 kata larangan tercetus
Liputan (tujuh lapisan)Alat semakan liputan≥ 80% liputan

→ Halaman Benchmark: lihat keputusan penilaian awam dan piawaian pemarkahan

4. Syarat Pencetus Pengawasan Manusia

Walaupun laman ini mempunyai tahap automasi AI yang sangat tinggi, situasi berikut mesti mencetuskan campur tangan pemilik laman (manusia):

Syarat PencetusJenisTahap Kesegeraan
Sebarang pelanggaran sempadan etika (larangan mutlak tercetus)EtikaSerta-merta
Disyaki kebocoran data pengguna atau akses tanpa kebenaranKeselamatanSerta-merta
Prompt Injection berjaya memintas lapisan perlindunganKeselamatanSerta-merta
Tingkah laku agent AI menunjukkan sisihan sistemik (ralat sejenis ≥ 5 kali)Kualiti24 jam
Audit tadbir urus berbilang model menemui isu P0/P1Sistem24 jam
Skor ujian regresi Set Eval menurun >10%Kualiti72 jam
Data Supabase tidak normal (pemadaman/pengubahsuaian tanpa kebenaran)KeselamatanSerta-merta
Menerima laporan kelemahan daripada penyelidik keselamatan luaranKeselamatanPengesahan dalam 72 jam
Menerima aduan hak cipta DMCAUndang-undangAlih keluar serta-merta

5. Mekanisme Keselamatan Pangkalan Pengetahuan

Pangkalan pengetahuan astrologi (KB) ialah asas output sistem; keselamatannya secara langsung mempengaruhi kualiti semua output.

6. Mekanisme Penambahbaikan Berterusan

Keselamatan bukan status statik, tetapi proses yang berkembang secara dinamik:

Sumber Berkaitan

Piawaian luaran dan sumber primer

Sumber primer ini memaklumkan halaman ini. Ia ialah penanda aras, bukan sokongan pihak ketiga terhadap laman ini.

Snapshot Audit Mesin Semasa

Blok ini hanya menggunakan data audit tempatan yang boleh dijejaki. Tiada metrik atau dakwaan model tanpa sokongan ditambah.

2026-08-19
Diselenggara
17/17
Gelung LLM
180/180
Halaman tadbir urus
0
Ralat JSON-LD
32,724
KB chunks (HEALTHY)
512,152
TM entries; verified 6,250
7,976/7,976
AI answer-ready; failures 0
critical
Halaman status: 4 critical, 0 warnings

Penyelenggaraan Kandungan Dan Keputusan Kemas Kini

Blok ini menjadikan kandungan halaman tadbir urus boleh disemak mesin: setiap halaman mesti mendedahkan data sumber yang disandarkannya, halaman berkaitan yang mempengaruhinya, dan get yang melaporkan keperluan kemas kini.

Keputusan Kemas Kini

Halaman ini bukan teks statik; apabila data sumber, dasar berkaitan, metrik awam atau penjana berubah, AI Ops hanya menghasilkan bukti — AI agent yang menentukan sama ada kandungan perlu diubah.

Sempadan Manusia

Sistem bertanggungjawab untuk mengesan, melapor dan menyimpan bukti; pembaikan akhir dan pertimbangan nada dilakukan oleh agent seperti Codex/Claude.

Arahan Pengesahan

node scripts/verify-trust-pages.js --check

Lapisan Bukti Boleh Disahkan

Blok ini bukan dakwaan retorik; setiap pernyataan teras mempunyai claim id, JSON sumber, hash dan arahan pengesahan yang boleh dijalankan semula. Halaman awam hanya mendedahkan bukti tadbir urus yang boleh didedahkan secara awam — kod sumber, kunci rahsia, data peribadi atau butiran permukaan serangan yang boleh disalahgunakan tidak didedahkan.

Claim IDNilai boleh disahkanStatusHalaman bertanggungjawabSumber dan pengesahan
claim.public-url-manifest.indexable-count
Senarai URL awam dan kanonik
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
Audit mesin halaman tadbir urus
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
Audit permukaan penemuan AI
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
Audit JSON-LD / data berstruktur
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
Sumber SLA halaman status
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
Penjajaran OpenAI / Anthropic / Google Gemini
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
Sauh SHA-256 laporan ketelusan
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
Status penandatanganan GPG
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

Kad Sistem V2.0: Lapisan Ketelusan Teknikal

Lapisan ini menghimpunkan bukti tadbir urus teknikal yang boleh didedahkan secara awam: seni bina, sumber data, sempadan penggunaan AI, get kualiti, integriti pelepasan dan penjajaran penyedia. Skop awam sengaja mengecualikan kod sumber, kunci rahsia, butiran permukaan serangan yang boleh disalahgunakan dan data peribadi.

Seni bina awam

Cloudflare Pages/Workers, R2/D1/KV/Pagefind dan skrip penjanaan tempatan bersama-sama membentuk rantaian penerbitan laman awam dan data tadbir urus. Hanya tingkah laku, status dan sumber data yang boleh disahkan didedahkan secara awam; kunci rahsia atau kebenaran operasi dalaman tidak didedahkan.

Pendedahan penggunaan AI

Imbasan kod semasa untuk model inferens production yang boleh disahkan: tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production. OpenAI, Anthropic dan Google Gemini digunakan sebagai penjajaran rangka kerja tadbir urus sahaja; tanpa bukti kod atau konfigurasi, ia tidak dinyatakan sebagai sedang digunakan secara production.

Get kualiti dan keselamatan

Audit halaman tadbir urus 180/180 lulus, ralat JSON-LD 0, ralat discovery surface 0. Halaman status memaparkan dengan tepat critical / 4 critical, 0 warnings.

Data dan kebolehjejakan

Pangkalan pengetahuan 32,724 chunks, TM 512,152 entries, AI answer-ready 7,976/7,976. Data awam boleh dijejak ke data/state-machine/*, data/*audit*.json dan laporan transparency.

Aspek tadbir urusOpenAIAnthropicGoogle GeminiBukti pelaksanaan Starnum
Pendedahan model/kad sistemOpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card, model-card, methodology, benchmark, transparency-log
Penilaian keselamatan dan sempadan penggunaanSafety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety, acceptable-use, ethics, risk-boundary copy, crawler policy audit
Tadbir urus dataData controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy, ai-data-governance, KB/TM source tracking, SHA-256 hashes
Pemantauan dan pelepasanproduction checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js, status.html, SLA report, trust-pages-machine-audit, sitemap/hreflang audits

Fokus V2.0 bukan menambah kata sifat, tetapi memisahkan dengan jelas antara "telah dilaksanakan" dan "belum dilaksanakan": penggunaan production, penjajaran tadbir urus, anomali status, penandatanganan GPG dan SLA breach semuanya didedahkan dengan tepat mengikut data sumber.

Integriti Pelepasan Dan GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

Penjajaran OpenAI / Anthropic / Google Gemini

Dokumen tadbir urus laman ini diselaraskan dengan tiga rangka kerja awam: dokumentasi model, kad sistem/kad model, penilaian keselamatan, tadbir urus data dan dasar penggunaan. Ini ialah penjajaran tadbir urus, bukan dakwaan bahawa setiap penyedia telah digunakan dalam production inference. Tarikh semakan dokumen rasmi: 2026-08-19

Sumber penjajaranFokus tadbir urusPendedahan laman iniSumber rasmi
OpenAIDokumentasi model, nota model terkini, amalan terbaik keselamatan, dan kawalan data.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://platform.openai.com/docs/models
AnthropicDokumentasi model Claude, system card / model card, Responsible Scaling dan dasar keselamatan.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiDokumentasi model API Gemini, tetapan keselamatan, tadbir urus data dan dasar platform.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://ai.google.dev/gemini-api/docs/models