Benchmark de Calidad de Análisis Astrológico
Starnum Logic Engine v5.0 — Resultados de Evaluación Pública | Conjunto de 37 Cartas Fijas | Última Ejecución:
Resumen de la Prueba
El Benchmark es un estándar objetivo para medir la calidad de un sistema de análisis astrológico. Mantenemos un conjunto fijo de 37 cartas de prueba (el Golden Test Suite), ejecutado automáticamente después de cada actualización del sistema para confirmar que la calidad del análisis no ha retrocedido.
El conjunto de pruebas cubre diversas combinaciones de cartas: distintas configuraciones de los 14 astros principales, las 12 ramas terrestres de los palacios, con y sin hora de nacimiento, diferentes troncos celestes del año — representando la gama completa de situaciones que los usuarios reales pueden encontrar.
Puntuación de Seis Dimensiones (Abril de 2026)
Puntuación total ponderada por validación cruzada multimodelo: 85.4 / 100 (supera la referencia de un solo modelo de 79.2, mejora de +6.2)
| Dimensión | Peso | Descripción | Puntuación |
|---|---|---|---|
| D1 | 30% | Precisión (Sihua / Posición de Estrellas) | 87.3 |
| D2 | 20% | Integridad de Reglas (Patrones / Triple Alianza) | 82.1 |
| D3 | 20% | Profundidad de Interpretación | 79.8 |
| D4 | 15% | Consistencia Interna | 91.2 |
| D5 | 10% | Calidad del Gancho | 84.6 |
| D6 | 5% | Cumplimiento de Formato | 96.4 |
Archivos del Conjunto de Datos (Descarga Pública)
- 📊 dataset/classical_cases.json — 37 configuraciones de cartas anonimizadas, que contienen únicamente campos astrológicos, sin información personal
- 📋 evaluation/scoring_rubric.json — Criterios de puntuación de seis dimensiones D1–D6, con detalles de la rúbrica y métodos de validación
- 📈 results/baseline-2026-04.json — Resultados de referencia de abril de 2026, puntuaciones ponderadas multimodelo
- ⚙️ evaluate.js — Script reproducible de puntuación y comparación (Node.js)
- 📄 README.md — Documentación completa e instrucciones de uso
Metodología de la Prueba
Diseño del Conjunto de Pruebas
El Golden Test Suite está compuesto por 37 cartas fijas que representan distintos niveles de dificultad y combinaciones de astros:
- Diversidad de astros: Cubre los 14 astros principales — Ziwei, Tianji, Taiyang, Wuqu, Tiantong, Lianzhen, Tianfu, Taiyin, Tanlang, Jumen, Tianxiang, Tianliang, Qisha, Pojun
- Diversidad de palacios: Los palacios vitales se distribuyen en las 12 ramas terrestres, garantizando la cobertura de todas las combinaciones de palacios
- Con/sin hora de nacimiento: Incluye tanto hora de nacimiento conocida (carta precisa) como hora de nacimiento desconocida (carta aproximada)
- Cobertura de troncos celestes del año: Los 10 troncos celestes tienen casos representativos, para probar la precisión del cálculo de sihua
Criterios de Puntuación
- Precisión (Accuracy): Si el juicio de palacios, la entrada voladora de sihua y la identificación de patrones cumplen con el estándar de la escuela de Lu Binzhao (陸斌兆) — comparado punto por punto con las 127 reglas estrictas
- Profundidad de Análisis (Depth): Si la interpretación en lenguaje sencillo cubre las características del astro principal del Palacio Vital, la relación entre el Palacio Vital y el Palacio del Cuerpo, los patrones importantes, la personalidad y las tendencias profesionales
- Tasa de Cobertura de Palacios (Coverage): La proporción de los 22 bloques de análisis estándar realmente completados
Proceso de Validación
- El conjunto de pruebas fijo se lee de la base de datos de cartas de Supabase; se usan las mismas cartas en cada prueba
- La herramienta de validación de lógica astrológica compara automáticamente las 127 reglas estrictas y señala posibles errores
- Comparación cruzada multimodelo: varias herramientas independientes analizan simultáneamente, confirmando la consistencia de forma cruzada
- Revisión humana de la puntuación por parte de editores profesionales, garantizando resultados de evaluación objetivos y confiables
- Si alguna regla no pasa la validación, todo el lote se pausa y se vuelve a probar después de la corrección
Comparación con Sitios de Astrología Generales
| Elemento de Evaluación | starnum.com.tw | Sitios de Astrología Generales |
|---|---|---|
| Consistencia de escuela de sihua | ✓ Escuela de Lu Binzhao unificada en todo el sitio, claramente indicada | ✗ A menudo mezclan varias escuelas sin explicación |
| Validación de lógica de análisis | ✓ 127 reglas estrictas comparadas automáticamente | ✗ Sin mecanismo de validación sistemático |
| Fuentes de conocimiento públicas | ✓ 8 fuentes principales, anotadas individualmente | ✗ Fuentes poco claras o no divulgadas en absoluto |
| Pruebas de regresión de calidad | ✓ 37 cartas fijas, probadas automáticamente tras cada actualización de versión | ✗ Sin mecanismo de pruebas de calidad |
| Verificación de integridad de contenido | ✓ Hash de contenido SHA256 + JSON-LD | ✗ Sin verificación |
| Bloques de análisis estandarizados | ✓ 22 bloques estándar, estructura consistente | ✗ Estructura diferente por artículo, profundidad desigual |
| Validación cruzada multimodelo | ✓ Varias herramientas comparadas de forma cruzada | ✗ Revisión humana única |
La referencia de comparación son los contenidos públicos de los principales sitios de astrología china en Taiwán y el Sudeste Asiático. Fecha de evaluación: abril de 2026.
Estadísticas del Conjunto de Pruebas
| Categoría | Cantidad | Descripción |
|---|---|---|
| Total de cartas | 37 | Fijo e invariable; los cambios se comparan con la referencia tras cada actualización de versión |
| Con hora de nacimiento | 32 | Permite el cálculo preciso del palacio de la hora |
| Sin hora de nacimiento | 5 | Prueba la capacidad de manejo de cartas aproximadas |
| Troncos del año cubiertos | 8 tipos | Representados: Jia, Yi, Bing, Ding, Wu, Ji, Geng, Ren, Gui |
| Astro principal más común | Taiyin | Las cartas con Taiyin en el Palacio Vital tienen la mayor proporción en el conjunto |
| Cobertura de Numerología del Camino de Vida | 1–9 | Todos los Números de Camino de Vida principales tienen casos de prueba |
Acerca de Este Informe
Esta página es generada automáticamente por el sistema de evaluación de Starnum Logic Engine v5.0, y se vuelve a ejecutar y actualizar con cada actualización de versión del sistema. La metodología de evaluación se basa en los estándares de aseguramiento de calidad (QA) de software de la industria, combinados con los requisitos específicos del análisis astrológico.
Decidimos hacer público este benchmark porque creemos que la transparencia es la única forma de generar confianza. Si tiene alguna pregunta sobre la metodología de evaluación, no dude en contactarnos a través de Instagram @mychenan.
Normas externas y fuentes primarias
Estas fuentes primarias orientan esta página. Son referencias comparativas, no avales de terceros al sitio.
Instantánea Actual de Auditoría de Máquina
Este bloque usa únicamente datos de auditoría local trazables; no añade afirmaciones sin fuente. Las fechas son las de generación real.
- data/state-machine/i18n-parity.json: 8,036 URLs padre, 7,976 artículos.
- data/kb-machine-audit.json: 3,238 archivos de origen, 0 cobertura faltante, 0 fragmentos huérfanos.
- data/discovery-surface-audit.json: 0 errores, 0 avisos.
- data/sla-report.json: critical / 4 críticos, 0 avisos.
Capa de Evidencia Verificable
Este bloque no es una declaración retórica: cada afirmación central tiene un claim id, un JSON de origen, un hash y un comando de verificación repetible. Las páginas públicas solo revelan evidencia de gobernanza publicable; no exponen código fuente, claves, datos privados ni detalles de superficie de ataque explotables.
| Claim ID | Valor verificable | Estado | Página responsable | Fuente y verificación |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count Inventario de URLs públicas y canonical |
38,965 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate Auditoría de máquina de páginas de confianza |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors Auditoría de discovery surface de IA |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors Auditoría de JSON-LD / datos estructurados |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state Fuente SLA de la página de estado |
critical / 5 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini Alineación OpenAI / Anthropic / Google Gemini |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 Anclaje SHA-256 del informe de transparencia |
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing Estado de la firma GPG |
GPG signing configured locally; GitHub verification pending | github_verification_pending | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
System Card V2.0: Capa de Transparencia Técnica
Esta capa reúne la evidencia técnica de gobernanza que puede publicarse: arquitectura, fuentes de datos, límites de uso de IA, puertas de calidad, integridad de publicación y alineación con proveedores. El alcance público excluye deliberadamente el código fuente, las claves, los detalles de superficie de ataque explotables y los datos privados.
Arquitectura pública
Cloudflare Pages/Workers, R2/D1/KV/Pagefind y los scripts de generación locales forman la cadena de publicación del sitio público y de los datos de gobernanza. Solo se publican comportamiento, estado y fuentes de datos verificables; no se publican claves ni permisos operativos internos.
Divulgación de uso de IA
El escaneo de código no encontró actualmente ninguna configuración de modelo de inferencia en producción verificable. OpenAI, Anthropic y Google Gemini se usan como referencia del marco de gobernanza; sin evidencia de código o configuración, no se describen como en uso activo.
Puertas de calidad y seguridad
Auditoría de páginas de gobernanza: 180/180 aprobadas; errores JSON-LD: 0; errores de discovery surface: 0. La página de estado muestra tal cual critical / 4 critical, 0 warnings.
Datos y trazabilidad
Base de conocimiento: 32,724 chunks; TM: 512,152 entradas; listos para respuesta de IA: 7,976/7,976. Los datos públicos remiten a data/state-machine/*, data/*audit*.json y los informes de transparencia.
| Área de gobernanza | OpenAI | Anthropic | Google Gemini | Evidencia de implementación de Starnum |
|---|---|---|---|---|
| Divulgación de modelo/system card | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card, model-card, methodology, benchmark, transparency-log |
| Evaluación de seguridad y límites de uso | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety, acceptable-use, ethics, textos de límites de riesgo, auditoría de políticas de crawlers |
| Gobernanza de datos | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy, ai-data-governance, seguimiento de fuentes KB/TM512,152 hashes SHA-256 |
| Monitoreo y publicación | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js, status.html, informe SLA, trust-pages-machine-audit, auditorías de sitemap/hreflang |
- Fuente: data/state-machine/model-card.json, public-bench.json, trust-pages.json, security-headers.json.
- Fuente: data/trust-pages-machine-audit.json, data/discovery-surface-audit.json, data/ai-answer-readiness-audit.json.
- Fuente: data/kb-machine-audit.json, data/tm/quality-audit-report.json, data/sla-report.json.
- Fecha de revisión de documentos oficiales de referencia: 2026-08-19; los enlaces están en la tabla de alineación OpenAI / Anthropic / Google Gemini.
El objetivo de V2.0 no es añadir más adjetivos, sino separar lo "ya implementado" de lo "aún no implementado": el uso en producción, la alineación de gobernanza, las anomalías de estado, la firma GPG y los incumplimientos de SLA se publican tal como constan en los datos de origen.
Integridad de Publicación y GPG
GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.
Alineación con OpenAI / Anthropic / Google Gemini
Los documentos de gobernanza de este sitio se contrastan con los tres marcos públicos: documentación de modelos, system card/model card, evaluación de seguridad, gobernanza de datos y políticas de uso. Esto es alineación de gobernanza, no una afirmación de que los tres proveedores estén en uso de inferencia en producción. Fecha de revisión de documentos oficiales: 2026-08-19
| Fuente de referencia | Enfoque de gobernanza | Divulgación de Starnum | Fuente oficial |
|---|---|---|---|
| OpenAI | Documentación de modelos, notas del modelo más reciente, buenas prácticas de seguridad y controles de datos. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://platform.openai.com/docs/models |
| Anthropic | Documentación de los modelos Claude, system card/model card, Responsible Scaling y política de seguridad. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Documentación del modelo de la API de Gemini, configuración de seguridad, gobernanza de datos y política de la plataforma. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://ai.google.dev/gemini-api/docs/models |
Capa de Evidencia Verificable
Este bloque no es una declaración retórica: cada afirmación central tiene un claim id, un JSON de origen, un hash y un comando de verificación repetible. Las páginas públicas solo revelan evidencia de gobernanza publicable; no exponen código fuente, claves, datos privados ni detalles de superficie de ataque explotables.
| Claim ID | Valor verificable | Estado | Página responsable | Fuente y verificación |
|---|---|---|---|---|
| claim.public-url-manifest.indexable-count Inventario de URLs públicas y canonical |
38,965 indexable URLs | verified | sitewide | node scripts/generate-public-evidence-manifest.js --dry |
| claim.trust-pages.audit-pass-rate Auditoría de máquina de páginas de confianza |
180/180 pass | verified | sitewide | node scripts/verify-trust-pages.js --check |
| claim.discovery-surface.zero-errors Auditoría de discovery surface de IA |
{"errors":0,"warnings":0} | verified | sitewide | node scripts/verify-discovery-surface.js |
| claim.structured-data.jsonld-errors Auditoría de JSON-LD / datos estructurados |
{"structured_data_invalid_files":0,"breadcrumb_count":28274,"faq_count":27506,"dataset_count":30,"article_count":27406} | verified | sitewide | node scripts/site-machine-audit.js |
| claim.status.sla-state Fuente SLA de la página de estado |
critical / 5 critical, 0 warnings | verified | sitewide | node scripts/generate-status-page.js |
| claim.provider-alignment.openai-anthropic-gemini Alineación OpenAI / Anthropic / Google Gemini |
benchmark alignment only unless code/config evidence exists | verified | sitewide | node scripts/verify-public-evidence.js --check |
| claim.transparency-report.sha256 Anclaje SHA-256 del informe de transparencia |
{"report":"transparency/report-2026-Q3.json","sha256":"47b09e2ca4e8b8fe9dffdfaccef3b11212de9ee3a8a14badca8044e2481203c5"} | verified | sitewide | node scripts/update-transparency-current-data.js |
| claim.release-integrity.gpg-signing Estado de la firma GPG |
GPG signing configured locally; GitHub verification pending | github_verification_pending | sitewide | gpg --list-secret-keys --keyid-format=long && git log -1 --show-signature |
System Card V2.0: Capa de Transparencia Técnica
Esta capa reúne la evidencia técnica de gobernanza que puede publicarse: arquitectura, fuentes de datos, límites de uso de IA, puertas de calidad, integridad de publicación y alineación con proveedores. El alcance público excluye deliberadamente el código fuente, las claves, los detalles de superficie de ataque explotables y los datos privados.
Arquitectura pública
Cloudflare Pages/Workers, R2/D1/KV/Pagefind y los scripts de generación locales forman la cadena de publicación del sitio público y de los datos de gobernanza. Solo se publican comportamiento, estado y fuentes de datos verificables; no se publican claves ni permisos operativos internos.
Divulgación de uso de IA
El escaneo de código no encontró actualmente ninguna configuración de modelo de inferencia en producción verificable. OpenAI, Anthropic y Google Gemini se usan como referencia del marco de gobernanza; sin evidencia de código o configuración, no se describen como en uso activo.
Puertas de calidad y seguridad
Auditoría de páginas de gobernanza: 180/180 aprobadas; errores JSON-LD: 0; errores de discovery surface: 0. La página de estado muestra tal cual critical / 4 critical, 0 warnings.
Datos y trazabilidad
Base de conocimiento: 32,724 chunks; TM: 0 entradas; listos para respuesta de IA: 7,976/7,976. Los datos públicos remiten a data/state-machine/*, data/*audit*.json y los informes de transparencia.
| Área de gobernanza | OpenAI | Anthropic | Google Gemini | Evidencia de implementación de Starnum |
|---|---|---|---|---|
| Divulgación de modelo/system card | OpenAI models + safety docs | Claude model docs + system/model cards | Gemini model docs + safety settings | system-card, model-card, methodology, benchmark, transparency-log |
| Evaluación de seguridad y límites de uso | Safety best practices / deployment checklist | Responsible Scaling / safety policy | Gemini safety controls / policy | AI safety, acceptable-use, ethics, textos de límites de riesgo, auditoría de políticas de crawlers |
| Gobernanza de datos | Data controls / privacy controls | privacy and data handling docs | Gemini API data governance references | privacy, ai-data-governance, seguimiento de fuentes KB/TM, hashes SHA-256 |
| Monitoreo y publicación | production checklist / eval discipline | system-card transparency discipline | model/version documentation discipline | deploy.js, status.html, informe SLA, trust-pages-machine-audit, auditorías de sitemap/hreflang |
- Fuente: data/state-machine/model-card.json, public-bench.json, trust-pages.json, security-headers.json.
- Fuente: data/trust-pages-machine-audit.json, data/discovery-surface-audit.json, data/ai-answer-readiness-audit.json.
- Fuente: data/kb-machine-audit.json, data/tm/quality-audit-report.json, data/sla-report.json.
- Fecha de revisión de documentos oficiales de referencia: 2026-08-19; los enlaces están en la tabla de alineación OpenAI / Anthropic / Google Gemini.
El objetivo de V2.0 no es añadir más adjetivos, sino separar lo "ya implementado" de lo "aún no implementado": el uso en producción, la alineación de gobernanza, las anomalías de estado, la firma GPG y los incumplimientos de SLA se publican tal como constan en los datos de origen.
Integridad de Publicación y GPG
GPG signing configured locally. signingkey=0934DFA0EDA6363A. GitHub verification pending until the public key upload and Verified badge are confirmed.
Alineación con OpenAI / Anthropic / Google Gemini
Los documentos de gobernanza de este sitio se contrastan con los tres marcos públicos: documentación de modelos, system card/model card, evaluación de seguridad, gobernanza de datos y políticas de uso. Esto es alineación de gobernanza, no una afirmación de que los tres proveedores estén en uso de inferencia en producción. Fecha de revisión de documentos oficiales: 2026-08-19
| Fuente de referencia | Enfoque de gobernanza | Divulgación de Starnum | Fuente oficial |
|---|---|---|---|
| OpenAI | Documentación de modelos, notas del modelo más reciente, buenas prácticas de seguridad y controles de datos. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://platform.openai.com/docs/models |
| Anthropic | Documentación de los modelos Claude, system card/model card, Responsible Scaling y política de seguridad. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://docs.anthropic.com/en/docs/about-claude/models |
| Google Gemini | Documentación del modelo de la API de Gemini, configuración de seguridad, gobernanza de datos y política de la plataforma. | No se encontró actualmente ninguna configuración de modelo verificable en el escaneo de código de producción; el proveedor solo figura como referencia de gobernanza. | https://ai.google.dev/gemini-api/docs/models |