Marchio BonketibaBONKETIBA
Bonketiba Intelligence Benchmark

Don't trust the claim. Reproduce the result.

Same question. Same evaluation. Evidence you can inspect.

Leaderboard

Leaderboard unavailable — insufficient independently measured data.

Servono almeno 3 run MISURATE per almeno due sistemi. Gli output dei concorrenti possono solo essere importati: restano IMPORTATI e non producono un ranking.

Leaderboard unavailable — insufficient independently measured data.

Explore and run

Esegui una missione con Bonketiba oppure importa l'output di un altro sistema: la rubrica applicata è identica.

Controlled test

Missione A — Legal research

Quali obblighi OHADA si applicano a una SARL costituita in Camerun nel 2026?

Giurisdizione
Cameroun · OHADA · CEMAC
Data del test
29/09/2026
Vincoli sulle fonti
Fonti pubbliche accessibili senza autenticazione; fonti primarie richieste dove esistono.
Budget di tempo
300 s
Run registrate

Nessuna run. Finché non esiste un run reale, nessun punteggio comparativo viene mostrato.

Metodologia pubblica

Dataset

Otto missioni A–H già pubblicate nella capability matrix: legal, financial, market entry, regulatory, import/export, due diligence, academic, multi-country. Le missioni non cambiano tra un sistema e l'altro.

Mission design

Ogni missione fissa domanda, giurisdizione, fatti attesi, fonti primarie attese, criteri di valutazione e rubrica. Gli stessi vincoli valgono per Bonketiba e per gli output importati.

Ground truth

La ground truth è la fonte primaria pubblica applicabile alla data del test. Dove la fonte primaria non è pubblicamente accessibile, la missione lo dichiara e il claim resta UNVERIFIED.

Annotators

La classificazione automatica dei claim è un pre-filtro. Il verdetto finale (VERIFIED / SUPPORTED / PARTIAL / CONTESTED / UNVERIFIED / INCORRECT) richiede un annotatore umano che lascia traccia nell'audit.

Evaluation

Otto componenti con pesi pubblicati: Knowledge Accuracy 20%, Evidence Coverage 20%, Citation Accuracy 15%, Source Quality 12%, Contradiction Resolution 10%, Jurisdiction Accuracy 10%, Freshness 8%, Actionability 5%.

Blind evaluation

Gli output sono etichettati System A–D. Il nome del sistema viene rivelato solo dopo che i verdetti sono stati registrati.

Limitations

L'estrazione automatica dei claim segue regole sintattiche: può separare male frasi complesse. Il controllo che una citazione sostenga davvero il claim resta umano.

Competitor access limitations

Bonketiba non ha accesso autorizzato alle API di Google, ChatGPT e Perplexity. I loro output possono solo essere importati dall'utente e restano IMPORTED: non li dichiariamo mai MEASURED e non stimiamo punteggi mancanti.

Differenziatore

Google finds. ChatGPT reasons. Perplexity researches.

Bonketiba: RESEARCH → EVIDENCE → VERIFICATION → ACTION → AUDIT.

La differenza dichiarata è una sola: Bonketiba tratta l'intera catena di ricerca come un oggetto verificabile. Non affermiamo che gli altri sistemi non possiedano queste capacità.

Implementation report

  • Benchmark schema (BenchmarkRun)Implementato

    Modello canonico con status MEASURED / IMPORTED / NOT_VERIFIED.

  • Missioni A–H eseguibiliImplementato

    Le otto missioni esistenti alimentano il protocollo controllato.

  • Claim extractionImplementato

    Regole sintattiche pubbliche, materialità dichiarata per ogni claim.

  • Evidence coverageImplementato

    Claim materiali separati da minori, non verificati ed errati.

  • Citation accuracyParzialmente implementato

    Esistenza, risolvibilità, pertinenza e attualità sono automatiche; il supporto reale al claim richiede conferma umana.

  • Source qualityImplementato

    Primary / official / institutional / secondary rate calcolati sull'host.

  • FreshnessImplementato

    CURRENT / OUTDATED / FUTURE / UNKNOWN per ogni claim temporalmente sensibile.

  • Contradiction scoringImplementato

    Rilevate, risolte e irrisolte con percentuale di risoluzione.

  • Jurisdiction accuracyImplementato

    Confronto tra giurisdizione citata e perimetro della missione.

  • Blind evaluationImplementato

    System A–D, rivelazione del nome solo dopo la valutazione.

  • Competitor importImplementato

    TXT, JSON e HTML completi; PDF limitato al testo leggibile presente nel file.

  • Run replayImplementato

    Stesso protocollo garantito, stesso testo generato esplicitamente non garantito.

  • Esecuzione automatica dei concorrentiBloccato da accesso API esterno

    Nessun accesso autorizzato alle API dei concorrenti: bloccato da vincolo esterno, non simulato.

  • Verdetti finali sui claimRichiede valutazione umana

    Richiedono un annotatore umano: l'automazione propone, la persona decide.