命理分析品质基准测试

Starnum Logic Engine v5.0 公开评测结果 | 37 组固定命盘集合 | 最后执行:

测试概览

基准测试(Benchmark)是衡量命理分析系统品质的客观标准。我们维护一组固定的 37 个命盘测试集(Golden Test Suite),每次系统更新后自动执行,确认分析品质没有退化。

测试集涵盖多种命盘组合:14 主星不同配置、12 宫位地支、有无出生时间、不同年干等,代表真实用户可能遇到的各种情境。

92
/ 100
准确性
88
/ 100
分析深度
94
/ 100
宫位覆盖率

测试套件版本:v1.0 | 测试集规模:37 个命盘 | 执行日期:2026-04-10

六维评分基准(2026 年 4 月)

多模型交叉验证加权总分:85.4 / 100(优于单模型基准 79.2,提升 +6.2)

维度权重说明得分
D130%准确性(四化 / 星位)87.3
D220%规则完整度(格局 / 三方)82.1
D320%解读深度79.8
D415%内部一致性91.2
D510%钩子品质84.6
D65%格式合规96.4

数据集文件(公开下载)

授权:CC BY 4.0 · 引用:Starnum Research Team (2026). starnum-bench v1.0.

测试方法论

测试集设计

Golden Test Suite(黄金测试集)由 37 个固定命盘组成,代表不同难度等级与星曜组合:

评分标准

验证流程

  1. 固定测试集从 Supabase 命盘数据库读取,每次测试使用相同命盘
  2. 命理逻辑验证工具自动比对 127 条硬规则,标记潜在错误
  3. 多模型交叉比对:多套独立工具同时分析,交叉确认结论一致性
  4. 专业编辑人工审查评分,确保评测结果客观可靠
  5. 若任一规则验证不通过,整批结果暂缓,修正后重新测试

与一般命理网站比较

评测项目 starnum.com.tw 一般命理网站
四化派系一致性 全站统一陆斌兆派,明确标注 常混用多派,未说明差异
分析逻辑验证 127 条硬规则自动比对 无系统性验证机制
公开知识来源 8 个主要来源,逐一标注 来源不明或完全不披露
品质回归测试 37 个固定命盘,版本更新后自动测试 无品质测试机制
内容完整性验证 SHA256 content hash + JSON-LD 无验证
分析区块标准化 22 个标准区块,结构一致 各篇结构不同,深度不均
多模型交叉验证 多套工具交叉比对 单一人工审查

比较基准为台湾与东南亚主要中文命理网站的公开内容,评估时间:2026 年 4 月。

测试集统计

分类数量说明
总命盘数37固定不变,版本更新后比对差异
有出生时间32可精确计算时宫
无出生时间5测试模糊排盘处理能力
覆盖年干8 种甲乙丙丁戊己庚壬癸均有代表
最常见主星太阴命宫太阴命盘在集合中占比最高
生命灵数覆盖灵数 1~9各主命数均有测试案例

数据来源:data/eval-set.json | 版本:1.0 | 生成时间:2026-04-10

关于本报告

本页面由 Starnum Logic Engine v5.0 的评测系统自动生成,每次系统版本更新后重新执行并更新数据。评测方法论参考业界软件品质保证(QA)标准,结合命理分析的特殊需求设计。

我们选择公开这份基准测试,是因为我们相信透明度是建立信任的唯一方式。若您对评测方法有任何疑问,欢迎通过 Instagram 联系 @mychenan

外部标准与一手来源

以下链接是本页治理判断采用的一手标准;它们是对照基准,不代表第三方为本站背书。

目前机器稽核快照

此区块只使用本机可追溯的稽核资料,不新增无来源宣称。日期为实际产出日。

2026-07-30
维护日期
17/17
LLM 闭环
180/180
治理页
0
JSON-LD 错误
32,724
KB chunks (HEALTHY)
789,031
TM entries; verified 34,781
7,976/7,976
AI answer-ready; failures 0
critical
状态页: 5 critical, 0 warnings

可查验 Evidence Layer

此区块不是口号;每一个核心宣称都有 claim id、来源 JSON、hash 与可重跑的验证指令。公开页只揭露可公开的治理证据,不公开原始码、密钥、私有资料或可被滥用的攻击面细节。

Claim ID可查验值状态责任页来源与验证
claim.public-url-manifest.indexable-count
公开 URL 与 canonical 清单
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
治理页机器稽核
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
AI discovery surface 稽核
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
JSON-LD / 结构化资料稽核
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
状态页 SLA 来源
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
OpenAI / Anthropic / Google Gemini 对标
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
透明度报告 SHA-256 锚定
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
GPG signing 状态
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

系统卡 V2.0:技术透明公开层

此层把可公开的技术治理证据集中呈现:架构、资料来源、AI 使用边界、品质闸门、发布完整性与供应商对标。公开范围刻意排除原始码、密钥、可被滥用的攻击面细节与私人资料。

公开架构

Cloudflare Pages/Workers、R2/D1/KV/Pagefind 与本机生成脚本共同构成公开网站与治理资料发布链。对外只公开行为、状态与可验证资料源,不公开密钥或内部操作权限。

AI 使用揭露

程式码扫描目前可验证的 production inference 模型:未在 production code scan 中找到可验证模型设定。OpenAI、Anthropic、Google Gemini 三方作为治理框架对标;未有程式码或设定证据者,不写成已上线使用。

品质与安全闸门

治理页稽核 180/180 通过、JSON-LD 错误 0、discovery surface 错误 0。状态页如实显示 critical / 5 critical, 0 warnings。

资料与可追溯性

知识库 32,724 chunks、TM 789,031 entries、AI answer-ready 7,976/7,976。公开数据追到 data/state-machine/*、data/*audit*.json 与 transparency 报告。

治理面向OpenAIAnthropicGoogle GeminiStarnum 落实证据
模型/系统卡揭露OpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card、model-card、methodology、benchmark、transparency-log
安全评估与使用边界Safety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit
资料治理Data controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes
监控与发布production checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits

V2.0 的重点不是多写形容词,而是把「已落实」与「尚未落实」分开:production 使用、治理对标、状态异常、GPG 签署、SLA breach 都依来源资料如实公开。

发布完整性与 GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

OpenAI / Anthropic / Google Gemini 对标

本站治理文件同步对照三家公开框架:模型文件、系统卡/模型卡、安全评估、资料治理与使用政策。这是治理对标,不等于宣称每一家都已用于 production inference。 官方文件检查日:2026-07-30

对标来源治理焦点本站揭露官方来源
OpenAI模型文件、最新模型说明、安全最佳实务、资料控制。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://platform.openai.com/docs/models
AnthropicClaude 模型文件、system card / model card、Responsible Scaling 与安全政策。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiGemini API 模型文件、安全设定、资料治理与平台政策。目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。https://ai.google.dev/gemini-api/docs/models