Evidencias antes que afirmaciones

Benchmark del flujo de investigación

Esta página publica el plan de medición antes que los resultados. Los valores en borrador son nulos y no pueden aparecer como afirmaciones de rendimiento.

Hay una capa real con la configuración normal de cada producto y otra controlada con el mismo modelo y corpus para Kosmico y una pila convencional.

Dos capas responden a preguntas distintas

La capa real compara Kosmico, ChatGPT Deep Research, NotebookLM y Elicit con sus configuraciones normales. La controlada aísla el espacio de trabajo frente a modelo, búsqueda académica, Zotero y Overleaf, manteniendo modelo y corpus.

El trabajo debe ser reproducible

Cuatro flujos, cinco disciplinas, tres repeticiones, dos expertos a ciegas y adjudicación. Se conservan ejecuciones, rúbrica, entorno y tamaños de muestra.

Ninguna cifra antes de la aprobación

Solo se publica cuando cada métrica es finita, existen fecha y URL de ejecuciones y la revisión aprueba la afirmación.

Estado del benchmark

Protocolo en borrador

draft

El protocolo es público, pero los resultados no. Cada valor permanece nulo hasta la revisión de evidencias y la publicación de las ejecuciones sin procesar.

Protocolo

4 flujos de trabajo, 5 ámbitos disciplinares, 3 repeticiones por condición, 2 evaluadores expertos a ciegas.

Condiciones

  • Configuración predeterminada de Kosmico (real)
  • ChatGPT Deep Research (real)
  • NotebookLM (real)
  • Elicit (real)
  • Condición controlada de Kosmico (controlada)
  • Modelo + búsqueda académica + Zotero + Overleaf (controlada)

Métricas

37

Medidas de flujo, autonomía, contexto, recuperación, evidencia, parada, fiabilidad, coste y visibilidad en LLM. Valores públicos: ninguno mientras sea borrador.

Evidencias conservadas

  • ejecuciones sin procesar
  • rúbrica de evaluación
  • manifiesto del entorno
  • tamaños de muestra

Respuestas directas

¿Hay resultados disponibles?

No. El informe actual es un protocolo en borrador sin cifras públicas de rendimiento.

¿Por qué una comparación controlada?

Ayuda a separar el efecto del espacio de trabajo de las diferencias entre modelos o corpus.

¿Se publicarán las ejecuciones?

La publicación exige URL, rúbrica, entorno, muestras y el proceso de evaluación declarado.