Evidenze prima delle affermazioni

Benchmark del flusso di ricerca

Questa pagina pubblica il piano di misurazione prima dei risultati. I valori in bozza sono nulli e non possono apparire come affermazioni prestazionali.

Il benchmark include un livello reale con la configurazione normale di ogni prodotto e un livello controllato con lo stesso modello e corpus per Kosmico e uno stack tradizionale.

Due livelli rispondono a domande diverse

Il livello reale confronta Kosmico, ChatGPT Deep Research, NotebookLM ed Elicit nelle configurazioni normali. Quello controllato isola lo spazio di lavoro mantenendo modello e corpus uguali rispetto a modello, ricerca accademica, Zotero e Overleaf.

Il lavoro deve essere riproducibile

Quattro flussi su cinque discipline, tre ripetizioni per condizione, due esperti in cieco e aggiudicazione. Si conservano esecuzioni grezze, rubrica, ambiente e numerosità dei campioni.

Nessun numero prima dell'approvazione

Un risultato viene pubblicato solo quando ogni metrica è finita, esistono URL delle esecuzioni e data, e la revisione delle evidenze approva l'affermazione.

Stato del benchmark

Protocollo in bozza

draft

Il protocollo è pubblico, ma i risultati non lo sono. Ogni valore resta nullo fino alla revisione delle evidenze e alla pubblicazione delle esecuzioni grezze.

Protocollo

4 flussi di lavoro, 5 ambiti disciplinari, 3 ripetizioni per condizione, 2 valutatori esperti in cieco.

Condizioni

  • Configurazione predefinita di Kosmico (reale)
  • ChatGPT Deep Research (reale)
  • NotebookLM (reale)
  • Elicit (reale)
  • Condizione controllata di Kosmico (controllata)
  • Modello + ricerca accademica + Zotero + Overleaf (controllata)

Metriche

37

Misure su flusso, autonomia, contesto, recupero, evidenze, arresto, affidabilità, costi e visibilità negli LLM. Valori pubblici: nessuno durante la bozza.

Evidenze conservate

  • esecuzioni grezze
  • rubrica di valutazione
  • manifesto dell'ambiente
  • numerosità dei campioni

Risposte dirette

I risultati sono disponibili?

No. Il rapporto attuale è un protocollo in bozza e non contiene numeri prestazionali pubblici.

Perché un confronto controllato?

Aiuta a separare l'effetto dello spazio di lavoro e della pipeline dalle differenze tra modelli o corpora.

Le esecuzioni saranno pubbliche?

La pubblicazione richiede URL delle esecuzioni, rubrica, ambiente, campioni e processo di valutazione dichiarato.