I risultati sono disponibili?
No. Il rapporto attuale è un protocollo in bozza e non contiene numeri prestazionali pubblici.
Evidenze prima delle affermazioni
Questa pagina pubblica il piano di misurazione prima dei risultati. I valori in bozza sono nulli e non possono apparire come affermazioni prestazionali.
Il benchmark include un livello reale con la configurazione normale di ogni prodotto e un livello controllato con lo stesso modello e corpus per Kosmico e uno stack tradizionale.
Il livello reale confronta Kosmico, ChatGPT Deep Research, NotebookLM ed Elicit nelle configurazioni normali. Quello controllato isola lo spazio di lavoro mantenendo modello e corpus uguali rispetto a modello, ricerca accademica, Zotero e Overleaf.
Quattro flussi su cinque discipline, tre ripetizioni per condizione, due esperti in cieco e aggiudicazione. Si conservano esecuzioni grezze, rubrica, ambiente e numerosità dei campioni.
Un risultato viene pubblicato solo quando ogni metrica è finita, esistono URL delle esecuzioni e data, e la revisione delle evidenze approva l'affermazione.
Stato del benchmark
Il protocollo è pubblico, ma i risultati non lo sono. Ogni valore resta nullo fino alla revisione delle evidenze e alla pubblicazione delle esecuzioni grezze.
4 flussi di lavoro, 5 ambiti disciplinari, 3 ripetizioni per condizione, 2 valutatori esperti in cieco.
37
Misure su flusso, autonomia, contesto, recupero, evidenze, arresto, affidabilità, costi e visibilità negli LLM. Valori pubblici: nessuno durante la bozza.
No. Il rapporto attuale è un protocollo in bozza e non contiene numeri prestazionali pubblici.
Aiuta a separare l'effetto dello spazio di lavoro e della pipeline dalle differenze tra modelli o corpora.
La pubblicazione richiede URL delle esecuzioni, rubrica, ambiente, campioni e processo di valutazione dichiarato.