命理分析品質基準測試
Starnum Logic Engine v5.0 公開評測結果 | 37 組固定命盤集合 | 最後執行:
測試概覽
基準測試(Benchmark)是衡量命理分析系統品質的客觀標準。我們維護一組固定的 37 個命盤測試集(Golden Test Suite),每次系統更新後自動執行,確認分析品質沒有退化。
測試集涵蓋多種命盤組合:14 主星不同配置、12 宮位地支、有無出生時間、不同年干等,代表真實用戶可能遇到的各種情境。
六維評分基準(2026 年 4 月)
多模型交叉驗證加權總分:85.4 / 100(優於單模型基準 79.2,提升 +6.2)
| 維度 | 權重 | 說明 | 得分 |
|---|---|---|---|
| D1 | 30% | 準確性(四化 / 星位) | 87.3 |
| D2 | 20% | 規則完整度(格局 / 三方) | 82.1 |
| D3 | 20% | 解讀深度 | 79.8 |
| D4 | 15% | 內部一致性 | 91.2 |
| D5 | 10% | 鉤子品質 | 84.6 |
| D6 | 5% | 格式合規 | 96.4 |
資料集檔案(公開下載)
- 📊 dataset/classical_cases.json — 37 組去識別化命盤配置,僅含命理欄位,無個人資訊
- 📋 evaluation/scoring_rubric.json — D1–D6 六維評分標準,含評分細則與驗證方法
- 📈 results/baseline-2026-04.json — 2026 年 4 月基準結果,多模型加權分數
- ⚙️ evaluate.js — 可重現評分與比較腳本(Node.js)
- 📄 README.md — 完整文件與使用說明
測試方法論
測試集設計
Golden Test Suite(黃金測試集)由 37 個固定命盤組成,代表不同難度等級與星曜組合:
- 星曜多樣性:覆蓋紫微、天機、太陽、武曲、天同、廉貞、天府、太陰、貪狼、巨門、天相、天梁、七殺、破軍 14 主星
- 宮位多樣性:命宮分布於 12 地支,確保各宮位組合均有覆蓋
- 有無時辰:包含有出生時間(精確排盤)與無出生時間(模糊排盤)兩種情況
- 年干覆蓋:10 天干均有代表案例,測試四化計算的準確性
評分標準
- 準確性(Accuracy):宮位判斷、四化飛入、格局識別是否符合陸斌兆派標準,逐條比對 127 條硬規則
- 分析深度(Depth):白話文解讀是否覆蓋命宮主星特質、命身宮關係、重要格局、命主個性與職業傾向等核心面向
- 宮位覆蓋率(Coverage):22 個標準分析區塊中實際完成的比例
驗證流程
- 固定測試集從 Supabase 命盤資料庫讀取,每次測試使用相同命盤
- 命理邏輯驗證工具自動比對 127 條硬規則,標記潛在錯誤
- 多模型交叉比對:多套獨立工具同時分析,交叉確認結論一致性
- 專業編輯人工審查評分,確保評測結果客觀可靠
- 若任一規則驗證不通過,整批結果暫緩,修正後重新測試
與一般命理網站比較
| 評測項目 | starnum.com.tw | 一般命理網站 |
|---|---|---|
| 四化派系一致性 | ✓ 全站統一陸斌兆派,明確標註 | ✗ 常混用多派,未說明差異 |
| 分析邏輯驗證 | ✓ 127 條硬規則自動比對 | ✗ 無系統性驗證機制 |
| 公開知識來源 | ✓ 8 個主要來源,逐一標註 | ✗ 來源不明或完全不揭露 |
| 品質回歸測試 | ✓ 37 個固定命盤,版本更新後自動測試 | ✗ 無品質測試機制 |
| 內容完整性驗證 | ✓ SHA256 content hash + JSON-LD | ✗ 無驗證 |
| 分析區塊標準化 | ✓ 22 個標準區塊,結構一致 | ✗ 各篇結構不同,深度不均 |
| 多模型交叉驗證 | ✓ 多套工具交叉比對 | ✗ 單一人工審查 |
比較基準為台灣與東南亞主要中文命理網站的公開內容,評估時間:2026 年 4 月。
測試集統計
| 分類 | 數量 | 說明 |
|---|---|---|
| 總命盤數 | 37 | 固定不變,版本更新後比對差異 |
| 有出生時間 | 32 | 可精確計算時宮 |
| 無出生時間 | 5 | 測試模糊排盤處理能力 |
| 覆蓋年干 | 8 種 | 甲乙丙丁戊己庚壬癸均有代表 |
| 最常見主星 | 太陰 | 命宮太陰命盤在集合中佔比最高 |
| 生命靈數覆蓋 | 靈數 1~9 | 各主命數均有測試案例 |
關於這份報告
本頁面由 Starnum Logic Engine v5.0 的評測系統自動產生,每次系統版本更新後重新執行並更新數據。評測方法論參考業界軟體品質保證(QA)標準,結合命理分析的特殊需求設計。
我們選擇公開這份基準測試,是因為我們相信透明度是建立信任的唯一方式。若您對評測方法有任何疑問,歡迎透過 Instagram 聯繫 @mychenan。
外部標準與一手來源
以下連結是本頁治理判斷採用的一手標準;它們是對照基準,不代表第三方替本站背書。
目前機器稽核快照
此區塊只使用本機可追溯的稽核資料,不新增無來源宣稱。日期為實際產出日。
- data/state-machine/i18n-parity.json: 8,036 parent URLs, 7,976 articles.
- data/kb-machine-audit.json: 3,238 source files, 0 missing coverage, 0 orphan chunks.
- data/discovery-surface-audit.json: 0 errors, 0 warnings.
- data/sla-report.json: critical / 3 critical, 1 warnings.
可查驗 Evidence Layer
此區塊不是口號;每一個核心宣稱都有 claim id、來源 JSON、hash 與可重跑的驗證指令。公開頁只揭露可公開的治理證據,不公開原始碼、密鑰、私有資料或可被濫用的攻擊面細節。
| Claim ID | 可查驗值 | 狀態 | 責任頁 | 來源與驗證 |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count 公開 URL 與 canonical 清單 |
39,104 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate 治理頁機器稽核 |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors AI discovery surface 稽核 |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors JSON-LD / 結構化資料稽核 |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state 狀態頁 SLA 來源 |
critical / 4 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini OpenAI / Anthropic / Google Gemini 對標 |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 透明度報告 SHA-256 錨定 |
{"report":"transparency/report-2026-Q3.json","sha256":"f154fc87139b42098b02567fc93582c30addafc406420b3aea8bae79b6f4ac93"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing GPG signing 狀態 |
GPG signing active locally; checked GitHub commit verification is valid | verified | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
系統卡 V2.0:技術透明公開層
此層把可公開的技術治理證據集中呈現:架構、資料來源、AI 使用邊界、品質閘門、發布完整性與供應商對標。公開範圍刻意排除原始碼、密鑰、可被濫用的攻擊面細節與私人資料。
公開架構
Cloudflare Workers、R2/D1/KV 與本機生成腳本共同構成公開網站與治理資料發布鏈。對外只公開行為、狀態與可驗證資料源,不公開密鑰或內部操作權限。
AI 使用揭露
程式碼掃描目前可驗證的 production inference 模型:未在 production code scan 中找到可驗證模型設定。OpenAI、Anthropic、Google Gemini 三方作為治理框架對標;未有程式碼或設定證據者,不寫成已上線使用。
品質與安全閘門
治理頁稽核 180/180 通過、JSON-LD 錯誤 0、discovery surface 錯誤 0。狀態頁如實顯示 critical / 3 critical, 1 warnings。
資料與可追溯性
知識庫 32,724 chunks、TM 512,152 entries、AI answer-ready 7,976/7,976。公開數據追到 data/state-machine/*、data/*audit*.json 與 transparency 報告。
| 治理面向 | OpenAI | Anthropic | Google Gemini | Starnum 落實證據 |
|---|---|---|---|---|
| 模型/系統卡揭露 | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card、model-card、methodology、benchmark、transparency-log |
| 安全評估與使用邊界 | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit |
| 資料治理 | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes |
| 監控與發布 | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits |
- 來源:data/state-machine/model-card.json、public-bench.json、trust-pages.json、security-headers.json。
- 來源:data/trust-pages-machine-audit.json、data/discovery-surface-audit.json、data/ai-answer-readiness-audit.json。
- 來源:data/kb-machine-audit.json、data/tm/quality-audit-report.json、data/sla-report.json。
- 官方對標文件檢查日:2026-08-20;連結列於 OpenAI / Anthropic / Google Gemini 對標表。
V2.0 的重點不是多寫形容詞,而是把「已落實」與「尚未落實」分開:production 使用、治理對標、狀態異常、GPG 簽署、SLA breach 都依來源資料如實公開。
發布完整性與 GPG
GPG signing active. signingkey=0934DFA0EDA6363A. Checked GitHub commit verification is valid.
OpenAI / Anthropic / Google Gemini 對標
本站治理文件同步對照三家公開框架:模型文件、系統卡/模型卡、安全評估、資料治理與使用政策。這是治理對標,不等於宣稱每一家都已用於 production inference。 官方文件檢查日:2026-08-20
| 對標來源 | 治理焦點 | 本站揭露 | 官方來源 |
|---|---|---|---|
| OpenAI | 模型文件、最新模型說明、安全最佳實務、資料控制。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://platform.openai.com/docs/models |
| Anthropic | Claude 模型文件、system card / model card、Responsible Scaling 與安全政策。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Gemini API 模型文件、安全設定、資料治理與平台政策。 | 目前未在 production code scan 中找到可驗證模型設定;模型供應商僅列為治理對標。 | https://ai.google.dev/gemini-api/docs/models |