Penanda Aras Kualiti Analisis Astrologi

Keputusan Penilaian Awam Starnum Logic Engine v5.0 | Set 37 Carta Tetap | Larian Terakhir:

Gambaran Keseluruhan Ujian

Penanda Aras (Benchmark) ialah piawaian objektif untuk mengukur kualiti sistem analisis astrologi. Kami mengekalkan set ujian 37 carta tetap (Golden Test Suite), dijalankan secara automatik selepas setiap kemas kini sistem untuk mengesahkan kualiti analisis tidak merosot.

Set ujian merangkumi pelbagai kombinasi carta: konfigurasi berbeza bagi 14 bintang utama, 12 cabang bumi istana, dengan dan tanpa masa lahir, tahun batang berbeza โ€” mewakili pelbagai situasi yang mungkin dihadapi pengguna sebenar.

92
/ 100
KETEPATAN
88
/ 100
KEDALAMAN ANALISIS
94
/ 100
LIPUTAN ISTANA

Versi Set Ujian: v1.0 | Saiz Set Ujian: 37 carta | Tarikh Larian: 2026-04-10

Pemarkahan Enam Dimensi (April 2026)

Skor jumlah wajaran pengesahan silang pelbagai model: 85.4 / 100 (mengatasi asas satu model 79.2, peningkatan +6.2)

DimensiWajaranKeteranganSkor
D130%Ketepatan (Si Hua / Kedudukan Bintang)87.3
D220%Kelengkapan Peraturan (Corak / Tiga Serangkai)82.1
D320%Kedalaman Tafsiran79.8
D415%Konsistensi Dalaman91.2
D510%Kualiti Hook84.6
D65%Pematuhan Format96.4

Fail Dataset (Muat Turun Awam)

Lesen: CC BY 4.0 ยท Petikan: Starnum Research Team (2026). starnum-bench v1.0.

Metodologi Ujian

Reka Bentuk Set Ujian

Golden Test Suite terdiri daripada 37 carta tetap yang mewakili pelbagai tahap kesukaran dan kombinasi bintang:

Kriteria Pemarkahan

Proses Pengesahan

  1. Set ujian tetap dibaca daripada pangkalan data carta Supabase; carta yang sama digunakan untuk setiap ujian
  2. Alat pengesahan logik astrologi secara automatik membandingkan semua 127 peraturan keras, menandakan ralat berpotensi
  3. Perbandingan silang pelbagai model: pelbagai alat bebas menganalisis serentak, mengesahkan konsistensi secara silang
  4. Semakan manusia oleh editor profesional terhadap pemarkahan, memastikan keputusan penilaian objektif dan boleh dipercayai
  5. Jika mana-mana pengesahan peraturan gagal, keseluruhan kelompok digantung dan diuji semula selepas pembetulan

Perbandingan Dengan Laman Astrologi Umum

Item Penilaian starnum.com.tw Laman Astrologi Umum
Konsistensi aliran Si Hua โœ“ Aliran Lu Binzhao seragam di seluruh laman, ditanda dengan jelas โœ— Sering mencampurkan pelbagai aliran tanpa penjelasan
Pengesahan logik analisis โœ“ 127 peraturan keras dibandingkan automatik โœ— Tiada mekanisme pengesahan sistematik
Sumber pengetahuan awam โœ“ 8 sumber utama, ditanda secara individu โœ— Sumber tidak jelas atau tidak didedahkan langsung
Ujian regresi kualiti โœ“ 37 carta tetap, diuji automatik selepas kemas kini versi โœ— Tiada mekanisme ujian kualiti
Pengesahan integriti kandungan โœ“ SHA256 content hash + JSON-LD โœ— Tiada pengesahan
Blok analisis piawai โœ“ 22 blok piawai, struktur konsisten โœ— Struktur berbeza setiap artikel, kedalaman tidak seragam
Pengesahan silang pelbagai model โœ“ Pelbagai alat dibandingkan secara silang โœ— Semakan manusia tunggal

Asas perbandingan ialah kandungan awam daripada laman astrologi Cina utama di Taiwan dan Asia Tenggara. Tarikh penilaian: April 2026.

Statistik Set Ujian

KategoriBilanganKeterangan
Jumlah carta37Tetap, perubahan dibandingkan dengan asas selepas kemas kini versi
Dengan masa lahir32Pengiraan istana masa yang tepat boleh dilakukan
Tanpa masa lahir5Menguji keupayaan mengendalikan pembinaan carta anggaran
Batang tahun diliputi8 jenisJia, Yi, Bing, Ding, Wu, Ji, Geng, Ren, Gui semuanya diwakili
Bintang utama paling biasaTai YinCarta Istana Kehidupan Tai Yin mempunyai perkadaran tertinggi dalam set
Liputan Life Path1โ€“9Semua Nombor Life Path utama mempunyai kes ujian

Sumber data: data/eval-set.json | Versi: 1.0 | Dijana: 2026-04-10

Mengenai Laporan Ini

Halaman ini dijana secara automatik oleh sistem penilaian Starnum Logic Engine v5.0, dijalankan semula dan dikemas kini pada setiap kemas kini versi sistem. Metodologi penilaian merujuk piawaian jaminan kualiti (QA) perisian industri, digabungkan dengan keperluan khusus analisis astrologi.

Kami memilih untuk mendedahkan penanda aras ini secara awam kerana kami percaya ketelusan adalah satu-satunya cara membina kepercayaan. Jika anda mempunyai sebarang soalan tentang metodologi penilaian, sila hubungi @mychenan di Instagram.

Piawaian luaran dan sumber primer

Sumber primer ini memaklumkan halaman ini. Ia ialah penanda aras, bukan sokongan pihak ketiga terhadap laman ini.

Snapshot Audit Mesin Semasa

Blok ini hanya menggunakan data audit tempatan yang boleh dijejaki. Tiada metrik atau dakwaan model tanpa sokongan ditambah.

2026-08-19
Diselenggara
17/17
Gelung LLM
180/180
Halaman tadbir urus
0
Ralat JSON-LD
32,724
KB chunks (HEALTHY)
512,152
TM entries; verified 6,250
7,976/7,976
AI answer-ready; failures 0
critical
Halaman status: 4 critical, 0 warnings

Lapisan Bukti Boleh Disahkan

Blok ini bukan dakwaan retorik; setiap pernyataan teras mempunyai claim id, JSON sumber, hash dan arahan pengesahan yang boleh dijalankan semula. Halaman awam hanya mendedahkan bukti tadbir urus yang boleh didedahkan secara awam โ€” kod sumber, kunci rahsia, data peribadi atau butiran permukaan serangan yang boleh disalahgunakan tidak didedahkan.

Claim IDNilai boleh disahkanStatusHalaman bertanggungjawabSumber dan pengesahan
claim.public-url-manifest.indexable-count
Senarai URL awam dan kanonik
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
Audit mesin halaman tadbir urus
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
Audit permukaan penemuan AI
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
Audit JSON-LD / data berstruktur
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
Sumber SLA halaman status
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
Penjajaran OpenAI / Anthropic / Google Gemini
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
Sauh SHA-256 laporan ketelusan
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
Status penandatanganan GPG
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

Kad Sistem V2.0: Lapisan Ketelusan Teknikal

Lapisan ini menghimpunkan bukti tadbir urus teknikal yang boleh didedahkan secara awam: seni bina, sumber data, sempadan penggunaan AI, get kualiti, integriti pelepasan dan penjajaran penyedia. Skop awam sengaja mengecualikan kod sumber, kunci rahsia, butiran permukaan serangan yang boleh disalahgunakan dan data peribadi.

Seni bina awam

Cloudflare Pages/Workers, R2/D1/KV/Pagefind dan skrip penjanaan tempatan bersama-sama membentuk rantaian penerbitan laman awam dan data tadbir urus. Hanya tingkah laku, status dan sumber data yang boleh disahkan didedahkan secara awam; kunci rahsia atau kebenaran operasi dalaman tidak didedahkan.

Pendedahan penggunaan AI

Imbasan kod semasa untuk model inferens production yang boleh disahkan: tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production. OpenAI, Anthropic dan Google Gemini digunakan sebagai penjajaran rangka kerja tadbir urus sahaja; tanpa bukti kod atau konfigurasi, ia tidak dinyatakan sebagai sedang digunakan secara production.

Get kualiti dan keselamatan

Audit halaman tadbir urus 180/180 lulus, ralat JSON-LD 0, ralat discovery surface 0. Halaman status memaparkan dengan tepat critical / 4 critical, 0 warnings.

Data dan kebolehjejakan

Pangkalan pengetahuan 32,724 chunks, TM 512,152 entries, AI answer-ready 7,976/7,976. Data awam boleh dijejak ke data/state-machine/*, data/*audit*.json dan laporan transparency.

Aspek tadbir urusOpenAIAnthropicGoogle GeminiBukti pelaksanaan Starnum
Pendedahan model/kad sistemOpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card, model-card, methodology, benchmark, transparency-log
Penilaian keselamatan dan sempadan penggunaanSafety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety, acceptable-use, ethics, risk-boundary copy, crawler policy audit
Tadbir urus dataData controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy, ai-data-governance, KB/TM source tracking, SHA-256 hashes
Pemantauan dan pelepasanproduction checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js, status.html, SLA report, trust-pages-machine-audit, sitemap/hreflang audits

Fokus V2.0 bukan menambah kata sifat, tetapi memisahkan dengan jelas antara "telah dilaksanakan" dan "belum dilaksanakan": penggunaan production, penjajaran tadbir urus, anomali status, penandatanganan GPG dan SLA breach semuanya didedahkan dengan tepat mengikut data sumber.

Integriti Pelepasan Dan GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

Penjajaran OpenAI / Anthropic / Google Gemini

Dokumen tadbir urus laman ini diselaraskan dengan tiga rangka kerja awam: dokumentasi model, kad sistem/kad model, penilaian keselamatan, tadbir urus data dan dasar penggunaan. Ini ialah penjajaran tadbir urus, bukan dakwaan bahawa setiap penyedia telah digunakan dalam production inference. Tarikh semakan dokumen rasmi: 2026-08-19

Sumber penjajaranFokus tadbir urusPendedahan laman iniSumber rasmi
OpenAIDokumentasi model, nota model terkini, amalan terbaik keselamatan, dan kawalan data.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://platform.openai.com/docs/models
AnthropicDokumentasi model Claude, system card / model card, Responsible Scaling dan dasar keselamatan.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiDokumentasi model API Gemini, tetapan keselamatan, tadbir urus data dan dasar platform.Tiada tetapan model yang boleh disahkan ditemui dalam imbasan kod production semasa; penyedia model hanya disenaraikan sebagai penjajaran tadbir urus.https://ai.google.dev/gemini-api/docs/models