命理分析品质基准测试
Starnum Logic Engine v5.0 公开评测结果 | 37 组固定命盘集合 | 最后执行:
测试概览
基准测试(Benchmark)是衡量命理分析系统品质的客观标准。我们维护一组固定的 37 个命盘测试集(Golden Test Suite),每次系统更新后自动执行,确认分析品质没有退化。
测试集涵盖多种命盘组合:14 主星不同配置、12 宫位地支、有无出生时间、不同年干等,代表真实用户可能遇到的各种情境。
六维评分基准(2026 年 4 月)
多模型交叉验证加权总分:85.4 / 100(优于单模型基准 79.2,提升 +6.2)
| 维度 | 权重 | 说明 | 得分 |
|---|---|---|---|
| D1 | 30% | 准确性(四化 / 星位) | 87.3 |
| D2 | 20% | 规则完整度(格局 / 三方) | 82.1 |
| D3 | 20% | 解读深度 | 79.8 |
| D4 | 15% | 内部一致性 | 91.2 |
| D5 | 10% | 钩子品质 | 84.6 |
| D6 | 5% | 格式合规 | 96.4 |
数据集文件(公开下载)
- 📊 dataset/classical_cases.json — 37 组去标识化命盘配置,仅含命理字段,无个人信息
- 📋 evaluation/scoring_rubric.json — D1–D6 六维评分标准,含评分细则与验证方法
- 📈 results/baseline-2026-04.json — 2026 年 4 月基准结果,多模型加权分数
- ⚙️ evaluate.js — 可重现评分与比较脚本(Node.js)
- 📄 README.md — 完整文档与使用说明
测试方法论
测试集设计
Golden Test Suite(黄金测试集)由 37 个固定命盘组成,代表不同难度等级与星曜组合:
- 星曜多样性:覆盖紫微、天机、太阳、武曲、天同、廉贞、天府、太阴、贪狼、巨门、天相、天梁、七杀、破军 14 主星
- 宫位多样性:命宫分布于 12 地支,确保各宫位组合均有覆盖
- 有无时辰:包含有出生时间(精确排盘)与无出生时间(模糊排盘)两种情况
- 年干覆盖:10 天干均有代表案例,测试四化计算的准确性
评分标准
- 准确性(Accuracy):宫位判断、四化飞入、格局识别是否符合陆斌兆派标准,逐条比对 127 条硬规则
- 分析深度(Depth):白话文解读是否覆盖命宫主星特质、命身宫关系、重要格局、命主个性与职业倾向等核心面向
- 宫位覆盖率(Coverage):22 个标准分析区块中实际完成的比例
验证流程
- 固定测试集从 Supabase 命盘数据库读取,每次测试使用相同命盘
- 命理逻辑验证工具自动比对 127 条硬规则,标记潜在错误
- 多模型交叉比对:多套独立工具同时分析,交叉确认结论一致性
- 专业编辑人工审查评分,确保评测结果客观可靠
- 若任一规则验证不通过,整批结果暂缓,修正后重新测试
与一般命理网站比较
| 评测项目 | starnum.com.tw | 一般命理网站 |
|---|---|---|
| 四化派系一致性 | ✓ 全站统一陆斌兆派,明确标注 | ✗ 常混用多派,未说明差异 |
| 分析逻辑验证 | ✓ 127 条硬规则自动比对 | ✗ 无系统性验证机制 |
| 公开知识来源 | ✓ 8 个主要来源,逐一标注 | ✗ 来源不明或完全不披露 |
| 品质回归测试 | ✓ 37 个固定命盘,版本更新后自动测试 | ✗ 无品质测试机制 |
| 内容完整性验证 | ✓ SHA256 content hash + JSON-LD | ✗ 无验证 |
| 分析区块标准化 | ✓ 22 个标准区块,结构一致 | ✗ 各篇结构不同,深度不均 |
| 多模型交叉验证 | ✓ 多套工具交叉比对 | ✗ 单一人工审查 |
比较基准为台湾与东南亚主要中文命理网站的公开内容,评估时间:2026 年 4 月。
测试集统计
| 分类 | 数量 | 说明 |
|---|---|---|
| 总命盘数 | 37 | 固定不变,版本更新后比对差异 |
| 有出生时间 | 32 | 可精确计算时宫 |
| 无出生时间 | 5 | 测试模糊排盘处理能力 |
| 覆盖年干 | 8 种 | 甲乙丙丁戊己庚壬癸均有代表 |
| 最常见主星 | 太阴 | 命宫太阴命盘在集合中占比最高 |
| 生命灵数覆盖 | 灵数 1~9 | 各主命数均有测试案例 |
关于本报告
本页面由 Starnum Logic Engine v5.0 的评测系统自动生成,每次系统版本更新后重新执行并更新数据。评测方法论参考业界软件品质保证(QA)标准,结合命理分析的特殊需求设计。
我们选择公开这份基准测试,是因为我们相信透明度是建立信任的唯一方式。若您对评测方法有任何疑问,欢迎通过 Instagram 联系 @mychenan。
外部标准与一手来源
以下链接是本页治理判断采用的一手标准;它们是对照基准,不代表第三方为本站背书。
目前机器稽核快照
此区块只使用本机可追溯的稽核资料,不新增无来源宣称。日期为实际产出日。
- data/state-machine/i18n-parity.json: 8,036 parent URLs, 7,976 articles.
- data/kb-machine-audit.json: 3,238 source files, 0 missing coverage, 0 orphan chunks.
- data/discovery-surface-audit.json: 0 errors, 0 warnings.
- data/sla-report.json: critical / 5 critical, 0 warnings.
可查验 Evidence Layer
此区块不是口号;每一个核心宣称都有 claim id、来源 JSON、hash 与可重跑的验证指令。公开页只揭露可公开的治理证据,不公开原始码、密钥、私有资料或可被滥用的攻击面细节。
| Claim ID | 可查验值 | 状态 | 责任页 | 来源与验证 |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count 公开 URL 与 canonical 清单 |
38,965 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate 治理页机器稽核 |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors AI discovery surface 稽核 |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors JSON-LD / 结构化资料稽核 |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state 状态页 SLA 来源 |
critical / 5 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini OpenAI / Anthropic / Google Gemini 对标 |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 透明度报告 SHA-256 锚定 |
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing GPG signing 状态 |
GPG signing configured locally; GitHub verification pending | github_verification_pending | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
系统卡 V2.0:技术透明公开层
此层把可公开的技术治理证据集中呈现:架构、资料来源、AI 使用边界、品质闸门、发布完整性与供应商对标。公开范围刻意排除原始码、密钥、可被滥用的攻击面细节与私人资料。
公开架构
Cloudflare Pages/Workers、R2/D1/KV/Pagefind 与本机生成脚本共同构成公开网站与治理资料发布链。对外只公开行为、状态与可验证资料源,不公开密钥或内部操作权限。
AI 使用揭露
程式码扫描目前可验证的 production inference 模型:未在 production code scan 中找到可验证模型设定。OpenAI、Anthropic、Google Gemini 三方作为治理框架对标;未有程式码或设定证据者,不写成已上线使用。
品质与安全闸门
治理页稽核 180/180 通过、JSON-LD 错误 0、discovery surface 错误 0。状态页如实显示 critical / 5 critical, 0 warnings。
资料与可追溯性
知识库 32,724 chunks、TM 789,031 entries、AI answer-ready 7,976/7,976。公开数据追到 data/state-machine/*、data/*audit*.json 与 transparency 报告。
| 治理面向 | OpenAI | Anthropic | Google Gemini | Starnum 落实证据 |
|---|---|---|---|---|
| 模型/系统卡揭露 | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card、model-card、methodology、benchmark、transparency-log |
| 安全评估与使用边界 | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety、acceptable-use、ethics、risk boundary copy、crawler policy audit |
| 资料治理 | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy、ai-data-governance、KB/TM source tracking、SHA-256 hashes |
| 监控与发布 | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js、status.html、SLA report、trust-pages-machine-audit、sitemap/hreflang audits |
- 来源:data/state-machine/model-card.json、public-bench.json、trust-pages.json、security-headers.json。
- 来源:data/trust-pages-machine-audit.json、data/discovery-surface-audit.json、data/ai-answer-readiness-audit.json。
- 来源:data/kb-machine-audit.json、data/tm/quality-audit-report.json、data/sla-report.json。
- 官方对标文件检查日:2026-07-30;连结列于 OpenAI / Anthropic / Google Gemini 对标表。
V2.0 的重点不是多写形容词,而是把「已落实」与「尚未落实」分开:production 使用、治理对标、状态异常、GPG 签署、SLA breach 都依来源资料如实公开。
发布完整性与 GPG
GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.
OpenAI / Anthropic / Google Gemini 对标
本站治理文件同步对照三家公开框架:模型文件、系统卡/模型卡、安全评估、资料治理与使用政策。这是治理对标,不等于宣称每一家都已用于 production inference。 官方文件检查日:2026-07-30
| 对标来源 | 治理焦点 | 本站揭露 | 官方来源 |
|---|---|---|---|
| OpenAI | 模型文件、最新模型说明、安全最佳实务、资料控制。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://platform.openai.com/docs/models |
| Anthropic | Claude 模型文件、system card / model card、Responsible Scaling 与安全政策。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Gemini API 模型文件、安全设定、资料治理与平台政策。 | 目前未在 production code scan 中找到可验证模型设定;模型供应商仅列为治理对标。 | https://ai.google.dev/gemini-api/docs/models |