Aller au contenu
← Tous les tags

inference-cost

9 contenus

Dispatch

Le harnais est une ligne de budget

Un proxy local (RTK) affiche 4,4 M de tokens « économisés » (45,3 %) sur 9 892 commandes cumulées (scope global). Ce chiffre se lit comme une facture réduite ; c'est une lecture incomplète. Cette « économie » n'existe que parce qu'un harnais (hooks, gates, routing) la produit et la maintient. Une part assumée de mon budget IA doit financer cet entretien, pas seulement des tokens de génération en plus.

ai-roi inference-cost coding-agents
Dispatch

Choisir un modèle quand les benchmarks ne suivent plus

À l'été 2026, les leaderboards LLM de référence ont gelé ou pivoté, et ce qui reste à jour est auto-rapporté par les constructeurs ou recopié par des agrégateurs non vérifiés. Un seul harnais indépendant tient encore — et il sature en haut de tableau. Résultat : la source de vérité qui reste, c'est ton propre codebase. Voici comment je tranche sans m'appuyer sur des chiffres que personne ne peut plus vérifier.

model-routing benchmarks inference-cost
Guide

Layerer les modèles d'un agent CLI à budget plafonné

Sous un abonnement à budget plafonné comme opencode Go, choisir un modèle ne se fait pas au prix du token mais aux requêtes par 5 h, à la seule source qualité encore vivante (vals.ai) et à la fiabilité du tool-calling — le critère décisif qu'aucun benchmark ne mesure. Le résultat : un modèle par preset, un frontier délégué hors de l'agent, et des outils contraints plutôt qu'instruits.

model-routing opencode-go inference-cost