Benchmark de Calidad de Análisis Astrológico

Starnum Logic Engine v5.0 — Resultados de Evaluación Pública | Conjunto de 37 Cartas Fijas | Última Ejecución:

Resumen de la Prueba

El Benchmark es un estándar objetivo para medir la calidad de un sistema de análisis astrológico. Mantenemos un conjunto fijo de 37 cartas de prueba (el Golden Test Suite), ejecutado automáticamente después de cada actualización del sistema para confirmar que la calidad del análisis no ha retrocedido.

El conjunto de pruebas cubre diversas combinaciones de cartas: distintas configuraciones de los 14 astros principales, las 12 ramas terrestres de los palacios, con y sin hora de nacimiento, diferentes troncos celestes del año — representando la gama completa de situaciones que los usuarios reales pueden encontrar.

92
/ 100
PRECISIÓN
88
/ 100
PROFUNDIDAD DE ANÁLISIS
94
/ 100
COBERTURA DE PALACIOS

Versión del Conjunto de Pruebas: v1.0 | Tamaño del Conjunto: 37 cartas | Fecha de Ejecución: 2026-04-10

Puntuación de Seis Dimensiones (Abril de 2026)

Puntuación total ponderada por validación cruzada multimodelo: 85.4 / 100 (supera la referencia de un solo modelo de 79.2, mejora de +6.2)

DimensiónPesoDescripciónPuntuación
D130%Precisión (Sihua / Posición de Estrellas)87.3
D220%Integridad de Reglas (Patrones / Triple Alianza)82.1
D320%Profundidad de Interpretación79.8
D415%Consistencia Interna91.2
D510%Calidad del Gancho84.6
D65%Cumplimiento de Formato96.4

Archivos del Conjunto de Datos (Descarga Pública)

Licencia: CC BY 4.0 · Cita: Starnum Research Team (2026). starnum-bench v1.0.

Metodología de la Prueba

Diseño del Conjunto de Pruebas

El Golden Test Suite está compuesto por 37 cartas fijas que representan distintos niveles de dificultad y combinaciones de astros:

Criterios de Puntuación

Proceso de Validación

  1. El conjunto de pruebas fijo se lee de la base de datos de cartas de Supabase; se usan las mismas cartas en cada prueba
  2. La herramienta de validación de lógica astrológica compara automáticamente las 127 reglas estrictas y señala posibles errores
  3. Comparación cruzada multimodelo: varias herramientas independientes analizan simultáneamente, confirmando la consistencia de forma cruzada
  4. Revisión humana de la puntuación por parte de editores profesionales, garantizando resultados de evaluación objetivos y confiables
  5. Si alguna regla no pasa la validación, todo el lote se pausa y se vuelve a probar después de la corrección

Comparación con Sitios de Astrología Generales

Elemento de Evaluación starnum.com.tw Sitios de Astrología Generales
Consistencia de escuela de sihua Escuela de Lu Binzhao unificada en todo el sitio, claramente indicada A menudo mezclan varias escuelas sin explicación
Validación de lógica de análisis 127 reglas estrictas comparadas automáticamente Sin mecanismo de validación sistemático
Fuentes de conocimiento públicas 8 fuentes principales, anotadas individualmente Fuentes poco claras o no divulgadas en absoluto
Pruebas de regresión de calidad 37 cartas fijas, probadas automáticamente tras cada actualización de versión Sin mecanismo de pruebas de calidad
Verificación de integridad de contenido Hash de contenido SHA256 + JSON-LD Sin verificación
Bloques de análisis estandarizados 22 bloques estándar, estructura consistente Estructura diferente por artículo, profundidad desigual
Validación cruzada multimodelo Varias herramientas comparadas de forma cruzada Revisión humana única

La referencia de comparación son los contenidos públicos de los principales sitios de astrología china en Taiwán y el Sudeste Asiático. Fecha de evaluación: abril de 2026.

Estadísticas del Conjunto de Pruebas

CategoríaCantidadDescripción
Total de cartas37Fijo e invariable; los cambios se comparan con la referencia tras cada actualización de versión
Con hora de nacimiento32Permite el cálculo preciso del palacio de la hora
Sin hora de nacimiento5Prueba la capacidad de manejo de cartas aproximadas
Troncos del año cubiertos8 tiposRepresentados: Jia, Yi, Bing, Ding, Wu, Ji, Geng, Ren, Gui
Astro principal más comúnTaiyinLas cartas con Taiyin en el Palacio Vital tienen la mayor proporción en el conjunto
Cobertura de Numerología del Camino de Vida1–9Todos los Números de Camino de Vida principales tienen casos de prueba

Fuente de datos: data/eval-set.json | Versión: 1.0 | Generado: 2026-04-10

Acerca de Este Informe

Esta página es generada automáticamente por el sistema de evaluación de Starnum Logic Engine v5.0, y se vuelve a ejecutar y actualizar con cada actualización de versión del sistema. La metodología de evaluación se basa en los estándares de aseguramiento de calidad (QA) de software de la industria, combinados con los requisitos específicos del análisis astrológico.

Decidimos hacer público este benchmark porque creemos que la transparencia es la única forma de generar confianza. Si tiene alguna pregunta sobre la metodología de evaluación, no dude en contactarnos a través de Instagram @mychenan.

Normas externas y fuentes primarias

Estas fuentes primarias orientan esta página. Son referencias comparativas, no avales de terceros al sitio.

Instantánea Actual de Auditoría de Máquina

Este bloque usa únicamente datos de auditoría local trazables; no añade afirmaciones sin fuente. Las fechas son las de generación real.

2026-08-19
Mantenimiento
17/17
Ciclos LLM cerrados
180/180
Páginas de gobernanza
0
Errores JSON-LD
32,724
Fragmentos de la KB (HEALTHY)
512,152
Entradas TM; verificadas 6,250
7,976/7,976
Listos para respuesta de IA; fallos 0
critical
Página de estado: 4 críticos, 0 avisos

Capa de Evidencia Verificable

Este bloque no es una declaración retórica: cada afirmación central tiene un claim id, un JSON de origen, un hash y un comando de verificación repetible. Las páginas públicas solo revelan evidencia de gobernanza publicable; no exponen código fuente, claves, datos privados ni detalles de superficie de ataque explotables.

Claim IDValor verificableEstadoPágina responsableFuente y verificación
claim.public-url-manifest.indexable-count
Inventario de URLs públicas y canonical
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
Auditoría de máquina de páginas de confianza
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
Auditoría de discovery surface de IA
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
Auditoría de JSON-LD / datos estructurados
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
Fuente SLA de la página de estado
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
Alineación OpenAI / Anthropic / Google Gemini
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
Anclaje SHA-256 del informe de transparencia
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
Estado de la firma GPG
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

System Card V2.0: Capa de Transparencia Técnica

Esta capa reúne la evidencia técnica de gobernanza que puede publicarse: arquitectura, fuentes de datos, límites de uso de IA, puertas de calidad, integridad de publicación y alineación con proveedores. El alcance público excluye deliberadamente el código fuente, las claves, los detalles de superficie de ataque explotables y los datos privados.

Arquitectura pública

Cloudflare Pages/Workers, R2/D1/KV/Pagefind y los scripts de generación locales forman la cadena de publicación del sitio público y de los datos de gobernanza. Solo se publican comportamiento, estado y fuentes de datos verificables; no se publican claves ni permisos operativos internos.

Divulgación de uso de IA

El escaneo de código no encontró actualmente ninguna configuración de modelo de inferencia en producción verificable. OpenAI, Anthropic y Google Gemini se usan como referencia del marco de gobernanza; sin evidencia de código o configuración, no se describen como en uso activo.

Puertas de calidad y seguridad

Auditoría de páginas de gobernanza: 180/180 aprobadas; errores JSON-LD: 0; errores de discovery surface: 0. La página de estado muestra tal cual critical / 4 critical, 0 warnings.

Datos y trazabilidad

Base de conocimiento: 32,724 chunks; TM: 512,152 entradas; listos para respuesta de IA: 7,976/7,976. Los datos públicos remiten a data/state-machine/*, data/*audit*.json y los informes de transparencia.

Área de gobernanzaOpenAIAnthropicGoogle GeminiEvidencia de implementación de Starnum
Divulgación de modelo/system cardOpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card, model-card, methodology, benchmark, transparency-log
Evaluación de seguridad y límites de usoSafety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety, acceptable-use, ethics, textos de límites de riesgo, auditoría de políticas de crawlers
Gobernanza de datosData controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy, ai-data-governance, seguimiento de fuentes KB/TM512,152 hashes SHA-256
Monitoreo y publicaciónproduction checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js, status.html, informe SLA, trust-pages-machine-audit, auditorías de sitemap/hreflang

El objetivo de V2.0 no es añadir más adjetivos, sino separar lo "ya implementado" de lo "aún no implementado": el uso en producción, la alineación de gobernanza, las anomalías de estado, la firma GPG y los incumplimientos de SLA se publican tal como constan en los datos de origen.

Integridad de Publicación y GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

Alineación con OpenAI / Anthropic / Google Gemini

Los documentos de gobernanza de este sitio se contrastan con los tres marcos públicos: documentación de modelos, system card/model card, evaluación de seguridad, gobernanza de datos y políticas de uso. Esto es alineación de gobernanza, no una afirmación de que los tres proveedores estén en uso de inferencia en producción. Fecha de revisión de documentos oficiales: 2026-08-19

Fuente de referenciaEnfoque de gobernanzaDivulgación de StarnumFuente oficial
OpenAIDocumentación de modelos, notas del modelo más reciente, buenas prácticas de seguridad y controles de datos.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://platform.openai.com/docs/models
AnthropicDocumentación de los modelos Claude, system card/model card, Responsible Scaling y política de seguridad.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiDocumentación del modelo de la API de Gemini, configuración de seguridad, gobernanza de datos y política de la plataforma.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://ai.google.dev/gemini-api/docs/models

Capa de Evidencia Verificable

Este bloque no es una declaración retórica: cada afirmación central tiene un claim id, un JSON de origen, un hash y un comando de verificación repetible. Las páginas públicas solo revelan evidencia de gobernanza publicable; no exponen código fuente, claves, datos privados ni detalles de superficie de ataque explotables.

Claim IDValor verificableEstadoPágina responsableFuente y verificación
claim.public-url-manifest.indexable-count
Inventario de URLs públicas y canonical
38,965 indexable URLs verified sitewide node scripts/generate-public-evidence-manifest.js --dry
claim.trust-pages.audit-pass-rate
Auditoría de máquina de páginas de confianza
180/180 pass verified sitewide node scripts/verify-trust-pages.js --check
claim.discovery-surface.zero-errors
Auditoría de discovery surface de IA
{"errors":0,"warnings":0} verified sitewide node scripts/verify-discovery-surface.js
claim.structured-data.jsonld-errors
Auditoría de JSON-LD / datos estructurados
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} verified sitewide node scripts/site-machine-audit.js
claim.status.sla-state
Fuente SLA de la página de estado
critical / 5 critical, 0 warnings verified sitewide node scripts/generate-status-page.js
claim.provider-alignment.openai-anthropic-gemini
Alineación OpenAI / Anthropic / Google Gemini
benchmark alignment only unless code/config evidence exists verified sitewide node scripts/verify-public-evidence.js --check
claim.transparency-report.sha256
Anclaje SHA-256 del informe de transparencia
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} verified sitewide node scripts/update-transparency-current-data.js
claim.release-integrity.gpg-signing
Estado de la firma GPG
GPG signing configured locally; GitHub verification pending github_verification_pending sitewide gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature

System Card V2.0: Capa de Transparencia Técnica

Esta capa reúne la evidencia técnica de gobernanza que puede publicarse: arquitectura, fuentes de datos, límites de uso de IA, puertas de calidad, integridad de publicación y alineación con proveedores. El alcance público excluye deliberadamente el código fuente, las claves, los detalles de superficie de ataque explotables y los datos privados.

Arquitectura pública

Cloudflare Pages/Workers, R2/D1/KV/Pagefind y los scripts de generación locales forman la cadena de publicación del sitio público y de los datos de gobernanza. Solo se publican comportamiento, estado y fuentes de datos verificables; no se publican claves ni permisos operativos internos.

Divulgación de uso de IA

El escaneo de código no encontró actualmente ninguna configuración de modelo de inferencia en producción verificable. OpenAI, Anthropic y Google Gemini se usan como referencia del marco de gobernanza; sin evidencia de código o configuración, no se describen como en uso activo.

Puertas de calidad y seguridad

Auditoría de páginas de gobernanza: 180/180 aprobadas; errores JSON-LD: 0; errores de discovery surface: 0. La página de estado muestra tal cual critical / 4 critical, 0 warnings.

Datos y trazabilidad

Base de conocimiento: 32,724 chunks; TM: 0 entradas; listos para respuesta de IA: 7,976/7,976. Los datos públicos remiten a data/state-machine/*, data/*audit*.json y los informes de transparencia.

Área de gobernanzaOpenAIAnthropicGoogle GeminiEvidencia de implementación de Starnum
Divulgación de modelo/system cardOpenAI models + safety docsClaude model docs + system/model cardsGemini model docs + safety settingssystem-card, model-card, methodology, benchmark, transparency-log
Evaluación de seguridad y límites de usoSafety best practices / deployment checklistResponsible Scaling / safety policyGemini safety controls / policyAI safety, acceptable-use, ethics, textos de límites de riesgo, auditoría de políticas de crawlers
Gobernanza de datosData controls / privacy controlsprivacy and data handling docsGemini API data governance referencesprivacy, ai-data-governance, seguimiento de fuentes KB/TM, hashes SHA-256
Monitoreo y publicaciónproduction checklist / eval disciplinesystem-card transparency disciplinemodel/version documentation disciplinedeploy.js, status.html, informe SLA, trust-pages-machine-audit, auditorías de sitemap/hreflang

El objetivo de V2.0 no es añadir más adjetivos, sino separar lo "ya implementado" de lo "aún no implementado": el uso en producción, la alineación de gobernanza, las anomalías de estado, la firma GPG y los incumplimientos de SLA se publican tal como constan en los datos de origen.

Integridad de Publicación y GPG

GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.

Alineación con OpenAI / Anthropic / Google Gemini

Los documentos de gobernanza de este sitio se contrastan con los tres marcos públicos: documentación de modelos, system card/model card, evaluación de seguridad, gobernanza de datos y políticas de uso. Esto es alineación de gobernanza, no una afirmación de que los tres proveedores estén en uso de inferencia en producción. Fecha de revisión de documentos oficiales: 2026-08-19

Fuente de referenciaEnfoque de gobernanzaDivulgación de StarnumFuente oficial
OpenAIDocumentación de modelos, notas del modelo más reciente, buenas prácticas de seguridad y controles de datos.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://platform.openai.com/docs/models
AnthropicDocumentación de los modelos Claude, system card/model card, Responsible Scaling y política de seguridad.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://docs.anthropic.com/en/docs/about-claude/models
Google GeminiDocumentación del modelo de la API de Gemini, configuración de seguridad, gobernanza de datos y política de la plataforma.No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza.https://ai.google.dev/gemini-api/docs/models