¿Hay resultados disponibles?
No. El informe actual es un protocolo en borrador sin cifras públicas de rendimiento.
Evidencias antes que afirmaciones
Esta página publica el plan de medición antes que los resultados. Los valores en borrador son nulos y no pueden aparecer como afirmaciones de rendimiento.
Hay una capa real con la configuración normal de cada producto y otra controlada con el mismo modelo y corpus para Kosmico y una pila convencional.
La capa real compara Kosmico, ChatGPT Deep Research, NotebookLM y Elicit con sus configuraciones normales. La controlada aísla el espacio de trabajo frente a modelo, búsqueda académica, Zotero y Overleaf, manteniendo modelo y corpus.
Cuatro flujos, cinco disciplinas, tres repeticiones, dos expertos a ciegas y adjudicación. Se conservan ejecuciones, rúbrica, entorno y tamaños de muestra.
Solo se publica cuando cada métrica es finita, existen fecha y URL de ejecuciones y la revisión aprueba la afirmación.
Estado del benchmark
El protocolo es público, pero los resultados no. Cada valor permanece nulo hasta la revisión de evidencias y la publicación de las ejecuciones sin procesar.
4 flujos de trabajo, 5 ámbitos disciplinares, 3 repeticiones por condición, 2 evaluadores expertos a ciegas.
37
Medidas de flujo, autonomía, contexto, recuperación, evidencia, parada, fiabilidad, coste y visibilidad en LLM. Valores públicos: ninguno mientras sea borrador.
No. El informe actual es un protocolo en borrador sin cifras públicas de rendimiento.
Ayuda a separar el efecto del espacio de trabajo de las diferencias entre modelos o corpus.
La publicación exige URL, rúbrica, entorno, muestras y el proceso de evaluación declarado.