# Ce que coûte vraiment l’IA locale et hébergée

Chaque mois, Léa et Marc préparent la même note de risque à partir de contrats, de tableaux et de sources publiques. Léa travaille sur un Mac 16 Go et confie les extractions répétitives à un modèle local. Marc utilise un modèle hébergé pour la synthèse la plus difficile. Tous deux obtiennent un document exploitable.

Lequel a coûté le moins cher ?

Il faut compter la machine, le temps, les jetons, les reprises, la vérification et le taux de livrables réellement acceptés. Une génération bon marché qui exige trois corrections peut coûter davantage qu’une génération plus chère qui aboutit du premier coup.

Cet article compare deux décisions distinctes : **utiliser Qwen 3.5 4B sur le Mac ou Claude Haiku 4.5 chez Anthropic**, puis **utiliser DeepSeek V4 Flash 0731 chez Umans ou Claude Sonnet 5 chez Anthropic**. La première comparaison éclaire le choix du lieu de calcul. La seconde compare deux offres hébergées. Chaque comparaison conserve son modèle, sa route et sa tâche propres.

## Les chiffres à retenir au 13 août 2026

| Cas | Facturation du modèle | Autres facteurs de décision |
| --- | --- | --- |
| Qwen 3.5 4B dans loqy | Aucune facture par jeton du fournisseur ou de loqy | Matériel, énergie, mémoire, stockage et temps du Mac |
| Claude Haiku 4.5 | 1 $ par million de jetons entrants, 5 $ par million de jetons sortants | Qualité sur la tâche, cache, outils, réseau et relectures |
| DeepSeek V4 Flash 0731 via Umans | 0,14 $ entrant, 0,28 $ sortant, 0,028 $ en lecture de cache | Mesure propre à cette route, conditions de service et frontière de données |
| Claude Sonnet 5 | 2 $ entrant, 10 $ sortant | Prix standard de l’API Anthropic |

Les montants sont exprimés en dollars hors taxes par million de jetons. Ils changent. La méthode et les sources datées figurent à la fin de l’article.

## L’inférence locale déplace le coût vers la machine

Avec un modèle local, aucun fournisseur ne facture chaque mot envoyé ou produit. Une fois le modèle téléchargé, une nouvelle génération n’ajoute pas de ligne proportionnelle à une facture d’API. Pour un travail fréquent, prévisible et compatible avec le modèle, ce coût marginal nul change fortement l’économie.

Le calcul utilise néanmoins des ressources réelles :

- le Mac doit déjà être disponible et suffisamment doté en mémoire unifiée ;
- les poids, le projecteur visuel et les caches occupent du stockage ;
- l’inférence consomme de l’énergie et produit de la chaleur ;
- la mémoire et le processeur graphique sont mobilisés pendant la génération ;
- la vitesse dépend de la machine, de la longueur du contexte et des autres charges ;
- le temps de l’utilisateur augmente si le modèle demande davantage de reprises.

Acheter un Mac uniquement pour l’inférence rend le matériel visible dans le calcul. Utiliser une machine déjà amortie pour des tâches courtes donne une situation différente. Le coût local n’est donc pas une constante universelle. Il dépend du parc existant et du taux d’utilisation.

![Deux empilements de coût comparent l’inférence locale et hébergée, de la facture par jeton aux ressources matérielles et au temps de vérification](/assets/blog/inference-cost-stack-fr.svg "L’inférence locale porte une facture fournisseur par jeton de 0 $ et utilise les ressources de la machine. L’inférence hébergée facture l’usage et porte la charge de génération.")

## Premier cas : Qwen 3.5 4B local ou Claude Haiku 4.5 hébergé

Dans le profil V1 prévu par loqy pour les Mac 16 Go, Qwen 3.5 4B utilise un fichier quantifié Q4_K_M de 2,55 Gio et un projecteur visuel séparé de 0,63 Gio. Son profil 16 Go réserve environ 7,8 Gio à l’inférence et lance le moteur avec une fenêtre technique de 131 072 jetons. Une exécution V1 reçoit une limite active plus basse : 16 384 jetons en mode Standard, 32 768 en mode Étendu et jusqu’à 65 536 en mode Profond. Le modèle d’origine est multimodal et publié sous licence Apache-2.0.

L’artefact Qwen exact forme un système : poids, quantification, moteur d’inférence, contexte et machine. Le débit et la qualité se mesurent sur cette configuration complète. [La méthode de qualification des modèles locaux](/fr/blog/how-loqy-evaluates-local-models/) fixe précisément cette unité de comparaison.

Claude Haiku 4.5 est un service différent. L’API Anthropic facture 1 $ par million de jetons entrants et 5 $ par million de jetons sortants. Le catalogue V1 de loqy l’expose comme modèle texte et image avec un contexte annoncé de 200 000 jetons. Le fournisseur prend en charge le matériel, la capacité et l’exploitation.

| Modèle | Entrée, par million de jetons | Sortie, par million de jetons |
| --- | ---: | ---: |
| Qwen 3.5 4B local | 0 $ de facture fournisseur | 0 $ de facture fournisseur |
| Claude Haiku 4.5 | 1 $ | 5 $ |

Le local devient intéressant lorsqu’il évite une dépense répétée, garde des données sur la machine, fonctionne hors ligne ou réduit la dépendance à un service. Haiku devient intéressant si sa vitesse, son contexte ou sa qualité font gagner davantage de temps que son prix ne coûte.

Cette comparaison porte sur le coût marginal et le lieu de calcul. La qualité de l’artefact Qwen exact relève de la qualification V1, avec ses propres tâches, mesures et critères d’admission.

## Deuxième cas : DeepSeek V4 Flash 0731 ou Claude Sonnet 5

Les deux modèles sont hébergés. Le fournisseur porte leur calcul et facture chaque requête. Le choix porte sur le prix, les performances utiles, la vitesse, les conditions de traitement et l’adéquation à la tâche.

loqy adresse la route exacte `umans-deepseek-v4-flash-0731` via Umans. Umans est le fournisseur présenté à l’utilisateur et sa politique documente le recours possible à des fournisseurs d’inférence tiers pour assurer la continuité. Voici les tarifs publics au 13 août 2026, hors taxes :

| Route | Entrée, par million de jetons | Sortie, par million de jetons | Moyenne simple |
| --- | ---: | ---: | ---: |
| DeepSeek V4 Flash 0731 via Umans | 0,14 $ | 0,28 $ | 0,21 $ |
| Claude Sonnet 5 via Anthropic | 2 $ | 10 $ | 6 $ |

**Sur la moyenne simple des tarifs d’entrée et de sortie, DeepSeek V4 Flash 0731 via Umans est environ 29 fois moins cher que Claude Sonnet 5.** Le montant facturé dépend ensuite de la part réelle de jetons entrants et sortants.

## Le prix prend son sens sur une tâche

Le laboratoire loqy du 6 août 2026 a exécuté une batterie bornée de tâches sur plusieurs modèles et niveaux de raisonnement. Sur le profil maximal retenu pour cette comparaison, la route exacte DeepSeek V4 Flash 0731 a obtenu un score agrégé de 0,6843, contre 0,6902 pour Claude Sonnet 5. Chaque cellule comptait 146 résultats stabilisés et les intervalles se recouvraient largement.

Le résultat porte sur un périmètre précis : **sur cette batterie loqy, avec ce profil et ces deux répétitions, les scores principaux étaient proches**. La rédaction, le code, la vision, les langues, les très longs contextes et les politiques d’outils relèvent de qualifications distinctes. Le meilleur profil DeepSeek de cette expérience utilisait un autre niveau d’effort.

La vitesse ajoute une autre dimension. À 16 h 34 le 13 août, la page de statut Umans affichait 299,6 jetons sortants par seconde en médiane sur cinq minutes pour la route 0731. Sa médiane quotidienne courante était de 285,2 et le pic quotidien publié atteignait 318,0. Artificial Analysis mesurait de son côté Claude Sonnet 5 en raisonnement élevé à 60,3 jetons par seconde sur les 72 dernières heures, avec 10 000 jetons entrants.

Ces deux repères publiés décrivent chacun leur propre protocole. Ils montrent qu’un fournisseur peut proposer un modèle ouvert très rapide, tandis que le temps complet dépend aussi de l’attente avant le premier jeton, du raisonnement interne, de la longueur de la réponse et des outils.

![Deux panneaux comparent Qwen 3.5 4B à Claude Haiku 4.5 pour le placement, puis DeepSeek V4 Flash 0731 à Claude Sonnet 5 pour le prix, la vitesse publiée et une évaluation loqy bornée](/assets/blog/model-cost-speed-comparison-fr.svg "Le premier panneau compare le placement et le coût marginal. Le second sépare prix, vitesse publiée selon deux protocoles et score sur une batterie loqy bornée.")

## Le prix inclut aussi la frontière de données

Une génération locale garde le contexte d’inférence sur le Mac. Une génération hébergée transmet le contexte admis au fournisseur choisi. Le prix du jeton rémunère donc aussi une infrastructure, une disponibilité et un contrat de traitement.

Umans annonce une politique ZDR pour le contenu des requêtes : les charges utiles, notamment les prompts, le code et les fichiers, sont traitées sans conservation comme données produit par défaut. Sa politique distingue ces contenus des métadonnées techniques et de sécurité qu’elle conserve, et prévoit un routage de continuité vers des fournisseurs tiers en cas de forte charge ou d’incident. Le périmètre ZDR correspond ainsi au contenu des requêtes.

Dans loqy, l’utilisateur choisit le modèle selon son besoin. Un travail confidentiel et compatible avec le modèle local peut rester sur la machine. Une tâche qui justifie une autre intelligence, un grand contexte ou un débit élevé peut appeler un modèle hébergé. Ce choix reste fixe pour l’exécution. [Le parcours d’une requête hébergée](/fr/blog/where-ai-agent-work-runs/) montre exactement quelles données franchissent cette frontière.

## Le bon dénominateur : un livrable accepté

Le coût utile d’un agent ne s’arrête pas à la réponse du modèle. Il faut compter la collecte des sources, les appels d’outils, les échecs, les nouvelles tentatives, le contrôle humain et la correction du livrable.

Une formule simple permet de comparer des scénarios :

> **Coût par livrable accepté = coût des modèles + coût machine + temps de contrôle + reprises et échecs, divisés par le nombre de livrables acceptés.**

Supposons qu’une route à 0,00336 $ produise un document acceptable une fois sur deux, avec dix minutes de correction. Une route à 0,06 $ qui réussit neuf fois sur dix et demande deux minutes de correction peut être économiquement préférable. Pour une extraction routinière bien couverte par Qwen local, la conclusion peut s’inverser.

Les preuves réduisent aussi le coût. Une note qui conserve ses sources, le modèle utilisé, les résultats d’outils et les décisions se vérifie plus vite. [Cette chaîne de preuves](/fr/blog/why-ai-agents-need-evidence/) rend le temps de revue mesurable au lieu de l’absorber dans une nouvelle recherche.

## Une règle de choix praticable

Le coût varie avec le travail. Une politique raisonnable peut partir de quatre questions :

1. Le modèle local produit-il un résultat acceptable sur cette tâche et cette machine ?
2. La donnée peut-elle quitter le Mac selon les exigences du projet ?
3. Le modèle hébergé économise-t-il assez de temps, de reprises ou de contexte pour justifier son prix ?
4. Les sources et les preuves permettent-elles de contrôler le résultat sans refaire tout le travail ?

Léa peut garder les extractions mensuelles en local et choisir Sonnet pour une négociation complexe. Marc peut employer DeepSeek via Umans pour des analyses volumineuses, puis réserver Sonnet aux cas où son comportement apporte un avantage constaté. Tous deux conservent la même règle : le placement et le modèle répondent au besoin, pas à une hiérarchie universelle.

## Méthode et périmètre

Chiffres vérifiés le 13 août 2026 :

- prix publics standard, hors taxes et remises, par million de jetons ;
- calculs simples centrés sur les tarifs de modèle ;
- route Umans nommée exactement pour DeepSeek V4 Flash 0731 ;
- débit Umans issu de sa page de statut et débit Sonnet issu d’Artificial Analysis, avec protocoles distincts ;
- score DeepSeek et Sonnet issu d’une évaluation loqy bornée ;
- comparaison Haiku et Qwen centrée sur le placement et le coût marginal ;
- coût local complété par le matériel, l’énergie et le temps humain propres à chaque usage.

Les tarifs et débits peuvent changer après publication. Le raisonnement reste valable : comparer des unités identiques, nommer la route et mesurer le coût du résultat accepté.

## Sources

- Catalogue des modèles locaux gérés par loqy
- Catalogue des modèles hébergés de loqy
- [Fiche officielle Qwen 3.5 4B](https://huggingface.co/Qwen/Qwen3.5-4B)
- [Tarifs de l’API Anthropic](https://platform.claude.com/docs/en/about-claude/pricing)
- [Statut de la route Umans DeepSeek V4 Flash 0731](https://status.umans.ai/status/umans-deepseek-v4-flash-0731)
- [Tarifs publics Umans](https://umans.ai/pricing)
- [Politique de confidentialité Umans Code](https://app.umans.ai/offers/code/legal/privacy-policy)
- [Mesure Artificial Analysis de Claude Sonnet 5](https://artificialanalysis.ai/models/claude-sonnet-5-high/providers)
- Évaluation bornée loqy du 6 août 2026
