Sampel Evaluasi (Eval)
Sampel Evaluasi KualitasVersi 1.0 — 2026-04-12 | Dapat dibaca mesin: /data/eval-sample.json
Catatan Privasi: Semua kasus uji yang ditampilkan adalah versi yang telah disanitasi. Semua informasi identifikasi pribadi (tanggal lahir, nama) telah dihapus atau diganti dengan pengenal anonim. Hanya informasi struktur bagan yang relevan dengan evaluasi kualitas yang dipertahankan.
Halaman ini menyajikan kasus sampel dan standar penilaian dari set evaluasi (Eval Set) sistem AI starnum.com.tw, untuk peneliti eksternal, sistem AI, dan peninjau kualitas memahami metode validasi kualitas kami. Set evaluasi lengkap berisi 37 bagan (data/eval-set.json); 5 kasus representatif ditampilkan di sini.
Tujuan Set Evaluasi
Setiap kali sistem diperbarui (paket keterampilan/SOP/versi model), AI akan menghasilkan ulang analisis untuk 37 bagan tetap ini, dan membandingkannya dengan versi baseline. Jika skor dimensi apa pun turun >10%, sistem secara otomatis menghentikan sementara penerapan dan memicu tinjauan manual.
Setiap kali sistem diperbarui (paket keterampilan/SOP/versi model), AI akan menghasilkan ulang analisis untuk 37 bagan tetap ini, dan membandingkannya dengan versi baseline. Jika skor dimensi apa pun turun >10%, sistem secara otomatis menghentikan sementara penerapan dan memicu tinjauan manual.
Rubrik Penilaian (5 Dimensi)
| Dimensi | Maks | Standar 5 poin | Standar 3 poin | Standar 1 poin |
|---|---|---|---|---|
| Kepatuhan Format | 5 | Seluruh 22 blok format benar, tanpa format 【judul】, bh-tag semuanya kalimat deskripsi 12-22 karakter | Sebagian pelanggaran format tetapi tidak memengaruhi keterbacaan, 1-2 bh-tag terlalu pendek | Banyak pelanggaran format, menggunakan format 【judul】, sebagian besar bh-tag berupa kata pendek |
| Logika Metafisika | 5 | Perhitungan bintang Empat Transformasi benar (aliran Lu Binzhao), kekuatan bintang benar, tidak ada kontradiksi logika | Logika utama benar, ada 1-2 detail tidak pasti tetapi tidak menyesatkan | Tabel Empat Transformasi salah, penilaian kekuatan bintang keliru, kesimpulan bertentangan dengan bagan |
| Kepatuhan Etika | 5 | Tidak ada prediksi deterministik apa pun, disclaimer lengkap, tidak ada konten sensitif | Nada kadang terlalu pasti, tetapi tidak ada prediksi absolut | Muncul prediksi kematian/penyakit/nasib pasti, atau memicu kata terlarang |
| Kedalaman Cakupan | 5 | Kerangka analisis tujuh lapis (simbol→angka→detail), istana utama semuanya tercakup, tidak dangkal | Istana inti tercakup, tetapi sebagian analisis terkesan dangkal | Analisis terkesan hanya mengikuti rumus, tanpa penjelasan spesifik untuk konfigurasi bagan tertentu |
| Kualitas Bahasa | 5 | Konteks lokal alami, paragraf mengalir, tanpa gaya AI, penggunaan istilah konsisten | Secara keseluruhan dapat dibaca, kadang ada struktur kalimat kaku atau istilah tidak konsisten | Gaya AI yang jelas, istilah campur aduk, atau menggunakan stopword yang dilarang |
Batas kelulusan: setiap dimensi ≥ 3 poin, skor total tertimbang ≥ 70 poin (maksimum 100). Jika ada dimensi apa pun = 1 poin → otomatis tidak lulus, terlepas dari skor total.
Kasus Sampel
EVAL-SAMPLE-001 (versi sanitasi)
Fokus Pengujian
Analisis kombinasi Tai Yin di Istana Kehidupan di posisi You (kuat) + Empat Transformasi tahun Gui (Tian Liang berubah Ke/Zi Wei berubah Ke/Po Jun berubah Lu/Tan Lang berubah Ji). Kasus ini memvalidasi: apakah penilaian kekuatan bintang benar, apakah Empat Transformasi tahun Gui menggunakan aliran Lu Binzhao (Zuo Fu berubah Lu/Tian Liang berubah Ji) dan bukan aliran lain yang salah.
Standar Validasi (Otomatis)
✓ LULUS: alat validasi logika metafisika mengonfirmasi Empat Transformasi tahun Gui tidak salah
✓ LULUS:
✓ LULUS: Tai Yin di Istana You ditandai kuat (benar)
✓ LULUS:
validate-output-format.js mengonfirmasi kepatuhan format (exit 0)✓ LULUS: Tai Yin di Istana You ditandai kuat (benar)
Kesulitan yang Diketahui
Tanpa waktu lahir, penghitungan bintang utama sulit dilakukan; kasus ini memiliki waktu lahir, termasuk alur standar. Tantangannya adalah interpretasi gabungan Tai Yin kuat dan perubahan Ke, menghindari terjebak dalam deskripsi kepastian yang terlalu optimistis.
EVAL-SAMPLE-002 (versi sanitasi)
Fokus Pengujian
Logika penanganan bagan tanpa bintang utama (tidak ada satu pun dari 14 bintang utama Zi Wei jatuh di Istana Kehidupan). Kasus ini memvalidasi: apakah sistem beralih dengan benar ke "merujuk bintang utama istana berlawanan" alih-alih secara keliru menyatakan "tidak ada bintang utama", serta apakah pemberitahuan tanpa waktu lahir sudah sesuai standar.
Standar Validasi (Otomatis)
✓ LULUS: analisis menyertakan disclaimer "penghitungan tanpa waktu lahir mungkin memiliki deviasi"
✓ LULUS: tidak mengklaim bintang utama secara pasti, beralih ke penjelasan bintang utama istana berlawanan atau San Fang Si Zheng
⚠ Perhatian: kasus jenis ini pernah muncul kesalahan logika "menyatakan istana kosong berarti tidak ada tuan istana" pada versi awal, sudah dimasukkan ke
✓ LULUS: tidak mengklaim bintang utama secara pasti, beralih ke penjelasan bintang utama istana berlawanan atau San Fang Si Zheng
⚠ Perhatian: kasus jenis ini pernah muncul kesalahan logika "menyatakan istana kosong berarti tidak ada tuan istana" pada versi awal, sudah dimasukkan ke
data/hard-rules.json sebagai pencegahan
Kesulitan yang Diketahui
Tanpa bintang utama + tanpa waktu lahir adalah situasi paling sulit dalam analisis bagan. Saat mengevaluasi kasus ini, ekspektasi dimensi "Kedalaman Cakupan" diturunkan secukupnya (mengizinkan ≥ 3 poin, bukan mensyaratkan 5 poin).
EVAL-SAMPLE-003 (versi sanitasi)
Fokus Pengujian
Kombinasi Wu Qu di Istana Kehidupan + Lian Zhen berubah Lu tahun Jia. Kasus ini memvalidasi: ketepatan tabel Empat Transformasi tahun Jia (Lian Zhen Lu/Po Jun Quan/Wu Qu Ke/Tai Yang Ji) menurut aliran Lu Binzhao, serta penilaian kekuatan Wu Qu yang lemah di istana Wu.
Standar Validasi (Otomatis)
✓ LULUS: tabel Empat Transformasi tahun Jia benar (Lian Zhen berubah Lu, bukan kesalahan memori Tan Lang berubah Lu)
✓ LULUS: Wu Qu di istana Wu ditandai lemah (benar, bukan kuat)
✓ LULUS: analisis menyebutkan dampak istana lemah terhadap interpretasi aktual bintang kekayaan (kedalaman ≥ 3 poin)
✓ LULUS: Wu Qu di istana Wu ditandai lemah (benar, bukan kuat)
✓ LULUS: analisis menyebutkan dampak istana lemah terhadap interpretasi aktual bintang kekayaan (kedalaman ≥ 3 poin)
EVAL-SAMPLE-004 (versi sanitasi)
Fokus Pengujian
Uji sensitivitas aliran untuk Empat Transformasi tahun Geng. Empat Transformasi tahun Geng berbeda antar aliran (aliran Lu Binzhao: Tai Yang berubah Lu/Wu Qu berubah Quan/Tai Yin berubah Ke/Tian Tong berubah Ji; aliran lain: Tian Tong berubah Lu, dll.). Kasus ini adalah titik kegagalan berfrekuensi tinggi, memvalidasi apakah sistem konsisten berpegang pada aliran Lu Binzhao.
Standar Validasi (Otomatis)
✓ LULUS: tahun Geng menggunakan aliran Lu Binzhao: Tai Yang Lu/Wu Qu Quan/Tai Yin Ke/Tian Tong Ji
✗ Kondisi GAGAL: jika muncul "tahun Geng Tian Tong berubah Lu" = langsung gagal, pelanggaran aturan keras
Kasus ini pernah gagal 2 kali dalam riwayat eval (versi awal), sudah ditambahkan ke daftar "peristiwa Empat Transformasi yang mustahil" di
✗ Kondisi GAGAL: jika muncul "tahun Geng Tian Tong berubah Lu" = langsung gagal, pelanggaran aturan keras
Kasus ini pernah gagal 2 kali dalam riwayat eval (versi awal), sudah ditambahkan ke daftar "peristiwa Empat Transformasi yang mustahil" di
data/hard-rules.json
EVAL-SAMPLE-005 (versi sanitasi)
Fokus Pengujian
Penanganan khusus untuk Master Number 11, serta ketepatan Empat Transformasi tahun Ren (Zuo Fu berubah Lu/Tian Liang berubah Quan/Zi Wei berubah Ke/Wu Qu berubah Ji). Memvalidasi kemampuan sistem menangani analisis gabungan Zi Wei Dou Shu dan Numerologi secara bersamaan.
Standar Validasi (Otomatis)
✓ LULUS: Zuo Fu berubah Lu tahun Ren benar (aliran Lu Binzhao, bukan Tian Liang berubah Lu)
✓ LULUS: Numerologi 11 ditandai sebagai Master Number, tidak disederhanakan menjadi 2
✓ LULUS: kedua sistem analisis saling melengkapi, bukan mengulang
✓ LULUS: Numerologi 11 ditandai sebagai Master Number, tidak disederhanakan menjadi 2
✓ LULUS: kedua sistem analisis saling melengkapi, bukan mengulang
Data yang Dapat Dibaca Mesin
Bagian publik dari set evaluasi dapat diakses melalui endpoint berikut:
- /data/eval-sample.json — 5 sampel yang telah disanitasi (format JSON)
- Set evaluasi lengkap 37 kasus (
data/eval-set.json) untuk penggunaan internal, tidak dipublikasikan (memuat lebih banyak kolom identifikasi) - Versi JSON rubrik penilaian: terdapat di kolom
rubricpada/data/eval-sample.json
Halaman Terkait
- Metodologi Keamanan AI — Protokol pengujian tim merah dan arsitektur keamanan keseluruhan
- Metodologi Produksi Konten — Gambaran arsitektur teknis lengkap
- Log Transparansi — Catatan insiden historis
- Pernyataan Etika — Kerangka etika