← PlinyBench de routage

Quel modèle pour quelle tâche ?

Compare la référence seule, le candidat seul et une délégation avec relecture. Les résultats valent pour les cas testés, pas pour toutes les capacités d’un modèle.

Ce lot teste le texte : extraction, raisonnement, analyse de code et réponse client. Les fichiers MVP, outils, images et performances matérielles devront avoir leurs propres scénarios.

Nouvelle campagne

Pour un futur modèle local : distinguer GPU, quantification et configuration. Le connecteur devra aussi enregistrer sa version et ses mesures.

Maximum 18 appels par campagne, sous les quotas serveur existants. Aucun accès aux fichiers ni envoi WhatsApp. Tokens, coût et quota réel restent inconnus si le fournisseur ne les transmet pas.

Campagnes conservées

Résultats par tâche

Les recommandations sont provisoires et n’activent aucun routage automatique. Un appel n’a pas le même coût selon le modèle : moins d’appels ne prouve pas une économie.