Don't trust the claim. Reproduce the result.
Same question. Same evaluation. Evidence you can inspect.
Leaderboard
Leaderboard unavailable — insufficient independently measured data.
Servono almeno 3 run MISURATE per almeno due sistemi. Gli output dei concorrenti possono solo essere importati: restano IMPORTATI e non producono un ranking.
Leaderboard unavailable — insufficient independently measured data.
Explore and run
Esegui una missione con Bonketiba oppure importa l'output di un altro sistema: la rubrica applicata è identica.
Missione A — Legal research
Quali obblighi OHADA si applicano a una SARL costituita in Camerun nel 2026?
- Giurisdizione
- Cameroun · OHADA · CEMAC
- Data del test
- 29/09/2026
- Vincoli sulle fonti
- Fonti pubbliche accessibili senza autenticazione; fonti primarie richieste dove esistono.
- Budget di tempo
- 300 s
Nessuna run. Finché non esiste un run reale, nessun punteggio comparativo viene mostrato.
Metodologia pubblica
Dataset
Otto missioni A–H già pubblicate nella capability matrix: legal, financial, market entry, regulatory, import/export, due diligence, academic, multi-country. Le missioni non cambiano tra un sistema e l'altro.
Mission design
Ogni missione fissa domanda, giurisdizione, fatti attesi, fonti primarie attese, criteri di valutazione e rubrica. Gli stessi vincoli valgono per Bonketiba e per gli output importati.
Ground truth
La ground truth è la fonte primaria pubblica applicabile alla data del test. Dove la fonte primaria non è pubblicamente accessibile, la missione lo dichiara e il claim resta UNVERIFIED.
Annotators
La classificazione automatica dei claim è un pre-filtro. Il verdetto finale (VERIFIED / SUPPORTED / PARTIAL / CONTESTED / UNVERIFIED / INCORRECT) richiede un annotatore umano che lascia traccia nell'audit.
Evaluation
Otto componenti con pesi pubblicati: Knowledge Accuracy 20%, Evidence Coverage 20%, Citation Accuracy 15%, Source Quality 12%, Contradiction Resolution 10%, Jurisdiction Accuracy 10%, Freshness 8%, Actionability 5%.
Blind evaluation
Gli output sono etichettati System A–D. Il nome del sistema viene rivelato solo dopo che i verdetti sono stati registrati.
Limitations
L'estrazione automatica dei claim segue regole sintattiche: può separare male frasi complesse. Il controllo che una citazione sostenga davvero il claim resta umano.
Competitor access limitations
Bonketiba non ha accesso autorizzato alle API di Google, ChatGPT e Perplexity. I loro output possono solo essere importati dall'utente e restano IMPORTED: non li dichiariamo mai MEASURED e non stimiamo punteggi mancanti.
Differenziatore
Google finds. ChatGPT reasons. Perplexity researches.
Bonketiba: RESEARCH → EVIDENCE → VERIFICATION → ACTION → AUDIT.
La differenza dichiarata è una sola: Bonketiba tratta l'intera catena di ricerca come un oggetto verificabile. Non affermiamo che gli altri sistemi non possiedano queste capacità.
Implementation report
- Benchmark schema (BenchmarkRun)Implementato
Modello canonico con status MEASURED / IMPORTED / NOT_VERIFIED.
- Missioni A–H eseguibiliImplementato
Le otto missioni esistenti alimentano il protocollo controllato.
- Claim extractionImplementato
Regole sintattiche pubbliche, materialità dichiarata per ogni claim.
- Evidence coverageImplementato
Claim materiali separati da minori, non verificati ed errati.
- Citation accuracyParzialmente implementato
Esistenza, risolvibilità, pertinenza e attualità sono automatiche; il supporto reale al claim richiede conferma umana.
- Source qualityImplementato
Primary / official / institutional / secondary rate calcolati sull'host.
- FreshnessImplementato
CURRENT / OUTDATED / FUTURE / UNKNOWN per ogni claim temporalmente sensibile.
- Contradiction scoringImplementato
Rilevate, risolte e irrisolte con percentuale di risoluzione.
- Jurisdiction accuracyImplementato
Confronto tra giurisdizione citata e perimetro della missione.
- Blind evaluationImplementato
System A–D, rivelazione del nome solo dopo la valutazione.
- Competitor importImplementato
TXT, JSON e HTML completi; PDF limitato al testo leggibile presente nel file.
- Run replayImplementato
Stesso protocollo garantito, stesso testo generato esplicitamente non garantito.
- Esecuzione automatica dei concorrentiBloccato da accesso API esterno
Nessun accesso autorizzato alle API dei concorrenti: bloccato da vincolo esterno, non simulato.
- Verdetti finali sui claimRichiede valutazione umana
Richiedono un annotatore umano: l'automazione propone, la persona decide.
