Bonketiba Knowledge Layer

Metodologia di misurazione

Questa pagina spiega cosa misuriamo, come lo misuriamo e come leggere la leaderboard e i report. Serve a rendere i risultati contestabili: chiunque può rifare i conti sui dataset esportati.

Criteri

Accuratezza Africa

Risposte corrette sul ground-truth africano

Formula: risposte giudicate corrette / risposte valutate (per lingua, poi media pesata sulle lingue del set)

Completezza

Quota di elementi attesi coperti

Formula: elementi attesi coperti / elementi attesi totali della domanda

Fonti primarie

Claim sostenuti da fonti primarie

Formula: claim con almeno una fonte primaria a supporto / claim valutati

Copertura linguistica

Lingue africane coperte con evidenza

Formula: lingue con almeno un claim verificato ed evidenza / lingue dichiarate nel set

Definizioni

Claim
Affermazione atomica soggetto–predicato–oggetto su un'entità africana, con lingua e giurisdizione.
EvidenceRef
Puntatore verificabile alla porzione di fonte (documento, pagina, locator) che sostiene o contesta il claim.
Fonte primaria
Atto ufficiale, gazzetta, registro pubblico o pubblicazione dell'ente titolare del dato. Le rassegne stampa non contano.
Ground truth
Giudizio umano di riferimento per una domanda in una lingua, prodotto da revisori indipendenti.
Baseline / set bloccato
Insieme versionato e congelato di domande e valori attesi: ogni run usa la stessa configurazione ed è confrontabile.
Conflitto
Due o più fonti sostengono valori incompatibili per lo stesso claim: la pagina lo mostra invece di nasconderlo.
Accordo inter-annotatore
Alfa di Krippendorff sui giudizi indipendenti: misura quanto il ground truth è affidabile, non quanto il sistema è bravo.

Come leggere la leaderboard

  1. 1. Ogni riga è un run su un set di benchmark bloccato: confronta solo righe con lo stesso set e versione.
  2. 2. Le percentuali sono calcolate sulle sole domande valutate; il numero di domande è nel dataset esportabile.
  3. 3. NOT COLLECTED significa che la metrica non è stata raccolta per quel run: non equivale a un risultato basso.
  4. 4. Dalla leaderboard puoi aprire i claim contestati con evidenceRefs, timeline di audit e confronto prima/dopo.
  5. 5. Ogni valore è riproducibile: scarica CSV/JSON dell'esatto set e run e ricalcola le formule qui sopra.

Come leggere i report di run

Un report contiene la configurazione del set (nome, versione, lingue), le metriche principali, l'accordo inter-annotatore per lingua e l'elenco delle deviazioni rispetto alla baseline. Le deviazioni oltre soglia sono segnalate come breach e restano tracciate nel piano di governance.

Endpoint di export