Run de calibration interne
Modèle composite via passerelle · 19 septembre 2026, 05:58
- Protocole
- LLM-360 v1.0
- Suite de tâches
- calibration v1
- Harnais
- runner v0.1
- Items lancés
- 20
- Items comptés
- 8
Les chiffres de ce run
Trois chiffres, trois niveaux de certitude. Nous affichons les trois, y compris celui que nous ne savons pas.
VOIE V4 — FIABILITÉ TECHNIQUE
37,5 %
d'échec de transport
3 items sur 8
IC 95 % (Wilson) : 14 – 69 %
Cet intervalle est large parce que l'effectif est petit. Nous l'affichons plutôt que de laisser croire à une précision que nous n'avons pas.
VOIE V6 — COÛT
0.056 $
par réponse reçue
0.2785 $ ÷ 5 réponses
Provisoire : non encore réconcilié avec la facturation du fournisseur.
VOIE V6 — CE QUI COMPTE
inconnu
par tâche accomplie
0 item abouti sur 8
Les 5 réponses reçues ne sont pas encore notées. Nous ne pouvons donc pas dire ce que coûte un résultat utilisable — alors nous le disons.
Les 8 items, un par un
Chaque ligne mène à sa trace complète. C'est la règle du produit : aucun chiffre sans preuve ouvrable.
| ITEM | TÂCHE | ÉTAT | DURÉE | HTTP | COÛT | |
|---|---|---|---|---|---|---|
| 1 | Extraction structurée depuis un texte long | À noter | 18,4 s | 200 | 0.0512 $ | voir la trace → |
| 4 | Calcul multi-étapes avec vérification | À noter | 22,2 s | 200 | 0.0631 $ | voir la trace → |
| 7 | Appel d'outil conditionnel | À noter | 15 s | 200 | 0.0448 $ | voir la trace → |
| 9 | Résumé fidèle sans ajout | À noter | 11,2 s | 200 | 0.0394 $ | voir la trace → |
| 12 | Raisonnement sur contrainte contradictoire | À noter | 26,5 s | 200 | 0.0800 $ | voir la trace → |
| 14 | Synthèse sur contexte étendu | Échec transport | 301,7 s | 504 | — | voir la trace → |
| 17 | Chaîne d'outils à trois appels | Échec transport | 301,8 s | 504 | — | voir la trace → |
| 19 | Reformulation sous contrainte de format | Échec transport | 301,7 s | 504 | — | voir la trace → |
Comment lire ce rapport — et ce qu'il ne dit pas
Ce rapport ne permet pas de juger la qualité de ce modèle. Aucun item n'est noté. La voie Justesse est vide, et c'est écrit partout où elle devrait apparaître.
Ce qu'il permet de juger, c'est la fiabilité de la chaîne technique : trois requêtes sur huit n'ont jamais reçu un seul octet, après plus de 301 secondes d'attente, sur un délai client fixé à 300 secondes. Un utilisateur réel aurait vécu exactement cela.
20 items ont été lancés, 8 sont comptés. Les 12 autres ne sont pas dissimulés : ils n'avaient pas terminé au moment de la clôture du run. Les inclure aurait faussé le dénominateur dans les deux sens.
Vous voulez ce niveau de détail sur votre système ?
La différence avec ce rapport : le vôtre portera sur au moins 50 items, et la voie Justesse sera remplie.