Le 10 août 2026, Meta a publié Muse Glimmer : une intelligence artificielle de trente milliards de paramètres, sous licence Apache 2.0, conçue pour tourner sur un ordinateur personnel. C’est son premier modèle à poids ouverts depuis Llama 4, seize mois plus tôt.

Quatre jours plus tôt, le 6 août, OpenAI faisait passer ChatGPT en texte illimité pour tous les comptes gratuits.

Deux façons opposées de ne rien payer, à quatre jours d’intervalle. Et une question que des millions de gens se posent sans jamais obtenir de réponse chiffrée : est-ce que l’IA qui tourne chez moi a rattrapé celle du cloud ?

La réponse est non. Voici de combien, ce que ça coûte vraiment, et la seule raison pour laquelle des gens le font quand même.


Résultats : le verdict en bref

Sur l’intelligence, ChatGPT gratuit gagne largement. Muse Glimmer se situe au niveau du réglage le plus bas du modèle gratuit d’OpenAI, et rien au-delà.

Sur le matériel, le ticket d’entrée est plus élevé qu’annoncé. Le modèle « tient sur un ordinateur personnel », mais sur un Mac ordinaire il produit trois mots par seconde. Pour qu’il devienne agréable, il faut une carte graphique qui coûte l’équivalent de quatre ans et demi d’abonnement ChatGPT.

Sur les données, le match est sans appel, dans l’autre sens. Rien ne quitte votre machine. En face, sur le palier gratuit, vos conversations servent par défaut à entraîner le modèle.

Et il existe un terrain où le local gagne pour une raison inattendue : l’agentique. Le mode agent est payant chez OpenAI, absent du gratuit — alors que c’est exactement ce pour quoi Meta a conçu son modèle, et qu’il est offert.

C’est un match entre deux choses qui ne se comparent pas terme à terme — et c’est précisément pour ça qu’il fallait le faire.


D’où viennent les chiffres de ce comparatif

Autant poser la méthode avant les chiffres. Chaque donnée se rejoue ligne à ligne :

  • Les scores d’intelligence viennent de l’indice d’Artificial Analysis, relevé réglage par réglage pour les deux modèles, afin que la comparaison porte sur des grandeurs équivalentes et non sur deux moyennes incomparables.
  • Les besoins en mémoire, les débits et les modes d’échec sont des mesures matérielles, rapportées à la carte concernée, en distinguant ce qui est mesuré de ce qui est estimé. Les chiffres AMD viennent du constructeur, ceux sur RTX et Apple de relevés indépendants.
  • Le contenu du palier gratuit de ChatGPT est établi depuis la documentation d’OpenAI et un inventaire de presse spécialisée.
  • Les calculs de point d’équilibre sont refaits à partir des prix constatés, avec les hypothèses écrites dans le texte.

Deux points ne sont pas mesurables en l’état, et nous les signalons plutôt que de les combler : la qualité du français, pour laquelle Meta ne publie aucune évaluation, et les plafonds exacts des images, fichiers et voix du palier gratuit, qu’OpenAI ne publie pas.


Les deux adversaires, côte à côte

Muse Glimmer 30B ChatGPT gratuit (GPT-5.6 Luna)
Éditeur et date Meta — 10 août 2026 OpenAI — palier gratuit basculé le 6 août 2026
Où ça tourne Sur votre machine Sur les serveurs d'OpenAI
Taille 30 Md de paramètres, transformeur dense non publiée
Contexte 131 072 jetons 1 000 000 de jetons (8 fois plus)
Entrées texte, image (encodeur de perception intégré) texte, image
Connaissances arrêtées au 4 janvier 2026 non publié (recherche web incluse)
Licence Apache 2.0, usage commercial libre service, conditions d'utilisation
Coût 0 € de licence, mais une machine 0 €, mais vos données

Une précision utile avant d’aller plus loin : Muse Glimmer est distillé depuis Muse Spark, le modèle propriétaire de Meta. Ce n’est pas un modèle bricolé à la marge, c’est une version condensée du haut de gamme maison.


Intelligence : l’écart, chiffré sur un indice commun

C’est le cœur du match, et la comparaison n’a de sens que si l’on descend au niveau du réglage. Un modèle de raisonnement n’a pas une intelligence, il en a autant que de niveaux d’effort.

Modèle et réglage Indice d'intelligence
ChatGPT gratuit — réglage bas 34
Muse Glimmer (sur votre machine) 35
ChatGPT gratuit — réglage moyen 39
ChatGPT gratuit — réglage élevé 47
ChatGPT gratuit — réglage très élevé 50
ChatGPT gratuit — maximum 52

Le résultat tient en une ligne : une intelligence artificielle gratuite tournant sur votre ordinateur atteint aujourd’hui le réglage le plus faible du ChatGPT gratuit, et rien au-dessus.

Ce n’est pas une humiliation, c’est même remarquable pour trente milliards de paramètres tenant dans dix-sept gigaoctets. Muse Glimmer devance d’ailleurs Gemma 4 31B de cinq points d’indice, et Artificial Analysis relève qu’il égale un modèle comptant trente-trois fois plus de paramètres au total. Face aux autres modèles ouverts de sa taille, il est en tête. Face au gratuit d’OpenAI, il plafonne.

Sur les épreuves agentiques, il se défend nettement mieux : MCP Atlas 75,5 ; DeepSearch QA 74,6 ; GAIA2 43,3 ; SWE-Bench Pro 51,2 ; AIME 2026 94,7 ; IFBench 77,0. C’est là que Meta a concentré ses efforts — des agents qui tiennent une tâche longue, appellent des outils et se remettent d’une erreur. Qwen le devance en revanche sur OSWorld-Verified, 75,6 contre 65,9, et sur la plupart des épreuves multimodales.


Ce qu’il faut comme machine : le vrai ticket d’entrée

« Tourne sur votre ordinateur » est vrai. Ce que la formule ne dit pas, c’est à quelle vitesse.

Matériel Mémoire Prix constaté Débit
Mac M3 / M4 d'entrée de gamme 24 Go unifiés déjà possédé 4,3 jetons/s (≈ 3 mots/s)
AMD Ryzen AI Max+ 395 unifiée machine complète jusqu'à 24 jetons/s
Apple M4 Max unifiée 23,7 → 37,8 jetons/s (×1,5)
RTX 3090 24 Go ≈ 1 248 $ d'occasion 65-70 jetons/s (estimé)
RTX 4090 24 Go ≈ 2 268 $ d'occasion 75 jetons/s (mesuré)
RTX 5090 32 Go 4 399 $ et plus 74,9 → 233,4 jetons/s (×3,1)

Retenez la première et la dernière ligne : 4,3 jetons par seconde contre 233,4. Un facteur cinquante-quatre, pour le même modèle.

Sur un Mac ordinaire, Muse Glimmer fonctionne — vous voyez le texte s’écrire à peu près à la vitesse d’une lecture attentive. C’est utilisable pour un résumé, pénible pour une conversation, inenvisageable pour un agent qui enchaîne des dizaines d’appels.

Un point mérite d’être souligné à la décharge de Meta : l’efficacité mémoire est remarquable. Un relevé indépendant sur RTX 4090 obtient 130 000 jetons de contexte dans 19,3 gigaoctets au total, sans compression du cache d’attention. Le schéma d’attention retenu est inhabituellement économe, et c’est un vrai travail d’ingénierie.


Le piège DFlash : pourquoi l’accélération par trois n’est pas pour vous

Meta met en avant un chiffre spectaculaire : de 74,9 à 233,4 jetons par seconde, soit une multiplication par 3,1. La technique s’appelle DFlash, un décodage spéculatif : un modèle compagnon de cinq couches et 5,11 gigaoctets propose des blocs de seize jetons en une seule passe, que le modèle principal vérifie en parallèle.

Faites l’addition.

17,3 gigaoctets pour le modèle, plus 5,11 pour le compagnon, égale 22,4 gigaoctets — avant le cache d’attention et avant l’encodeur visuel. Sur une carte de 24 gigaoctets dont environ 23,5 sont réellement utilisables, il reste à peu près un gigaoctet. Soit quelques milliers de jetons de contexte, et aucune image.

L’accélération par trois n’est donc atteignable qu’à partir de 32 gigaoctets, c’est-à-dire sur une RTX 5090 à 4 399 dollars. Sur les cartes de 24 gigaoctets — celles que Meta désigne pourtant comme cible — le compagnon, le cache et l’encodeur se disputent environ six gigaoctets qui n’existent pas.

Les machines Apple à mémoire unifiée échappent en partie au problème et gagnent 1,5 fois au lieu de 3,1. C’est moins spectaculaire, mais c’est réel.


Trois façons de se planter à l’installation

Ce sont les trois erreurs qui reviennent, et deux d’entre elles échouent en silence — c’est-à-dire de la pire façon possible.

La carte de 16 gigaoctets. Le fichier en quatre bits pèse 17,3 gigaoctets. Il ne rentre pas. Ollama charge alors ce qui tient et répartit discrètement le reste sur le processeur : sur un modèle dense de trente milliards de paramètres, la vitesse tombe à un chiffre en unités de jetons par seconde. Rien n’indique l’erreur, le modèle répond simplement très mal.

Le décodage spéculatif sur 24 gigaoctets. Même mécanisme : activer l’option fait déborder sur le processeur. Le contrôle est simple — la commande ollama ps doit afficher 100 % GPU dans la colonne du processeur. Toute autre valeur signale le débordement.

La version d’Ollama. La 0.32.7 échouait purement et simplement sur matériel NVIDIA et AMD. La 0.32.8 est requise hors machines Apple.

Quant au choix de la quantification, il se résume ainsi : la version officielle en quatre bits pèse 17 gigaoctets et vise les cartes de 24 ; la variante communautaire en cinq bits monte à 20,1 et mange d’autant la place du contexte ; celle en huit bits atteint 29,6 et exige une carte de 32. La quantification dynamique officielle de Meta, réservée aux 32 gigaoctets, revendique 0,2 % d’écart de précision avec la pleine précision.


Ce que ChatGPT gratuit donne vraiment depuis le 6 août

En face, l’offre a changé de nature le 6 août 2026 — et elle est moins généreuse que le mot « illimité » ne le laisse croire.

Ce qui est illimité : le texte, et lui seul. Les comptes gratuits envoient autant de messages textuels qu’ils veulent, mais sont verrouillés sur un seul modèle, GPT-5.6 Luna, le plus petit de la famille GPT-5.6, et sur un seul mode de raisonnement.

Ce qui reste plafonné :

  • la génération d’images, avec une limite quotidienne qu’OpenAI ne publie pas et ajuste selon la charge de ses serveurs ;
  • l’envoi de fichiers, avec une bibliothèque limitée à 500 mégaoctets ;
  • la voix, disponible mais basculée sur un modèle allégé ;
  • la recherche approfondie et le mode agent, purement et simplement réservés aux formules payantes.

La recherche web, elle, est incluse — et c’est un avantage structurel que Muse Glimmer n’a pas : ses connaissances s’arrêtent au 4 janvier 2026, définitivement, sauf à lui brancher soi-même un outil de recherche.


Le renversement : le mode agent est payant chez OpenAI, gratuit chez Meta

Voici le point qui inverse une partie du verdict, et qu’aucun comparatif ne relève.

Sur le palier gratuit de ChatGPT, le mode agent et la recherche approfondie sont purement et simplement absents : ce sont des fonctions payantes. Un utilisateur gratuit dispose d’un assistant conversationnel, pas d’un exécutant qui enchaîne des tâches.

Or c’est exactement ce pour quoi Muse Glimmer a été conçu. Meta ne l’a pas optimisé pour la conversation mais pour des agents locaux permanents : appel d’outils, mémoire de tâche, reprise après échec, sessions longues. Et ses résultats sur ces épreuves-là ne sont pas anecdotiques — MCP Atlas 75,5, l’épreuve du dialogue avec des outils externes, DeepSearch QA 74,6, GAIA2 43,3.

La conséquence pratique est nette. Sur le seul terrain agentique, le rapport s’inverse : le gratuit local fait ce que le gratuit en ligne ne fait pas — non pas parce qu’il est meilleur, mais parce que l’autre le facture.

À quoi s’ajoute l’absence totale de quota. Un agent qui tourne six heures d’affilée sur votre machine ne consomme rien d’autre que de l’électricité. Le même agent sur une interface de programmation en ligne se paie au jeton, et se heurte à des plafonds.

C’est la nuance qui empêche de conclure trop vite : ChatGPT gratuit gagne le match de l’assistant, Muse Glimmer gagne celui de l’exécutant.


Comment on l’installe, concrètement

Un comparatif qui recommande un modèle local sans dire comment on l’obtient rend un service incomplet. La voie courante tient en quelques minutes.

Le modèle est distribué officiellement sur Ollama, sous le nom muse-glimmer, avec ses variantes quantifiées. Il est également disponible sur LM Studio, qui offre une interface graphique pour ceux qui préfèrent éviter le terminal, et sur Hugging Face pour qui veut les poids bruts.

Trois vérifications avant de lancer quoi que ce soit :

  1. La mémoire disponible. Comptez 18 gigaoctets minimum de mémoire vive ou vidéo réellement libres — pas la mémoire totale de la machine. Sur un Mac à mémoire unifiée, le système en consomme déjà une partie.
  2. La version d’Ollama. 0.32.8 ou plus récent hors machines Apple, faute de quoi le chargement échoue sur NVIDIA comme sur AMD.
  3. La quantification. Prenez la version officielle en quatre bits si vous avez 24 gigaoctets ; la version en huit bits, plus fidèle, exige 32 gigaoctets.

Après le premier lancement, un seul contrôle vaut la peine : ollama ps doit afficher 100 % GPU dans la colonne du processeur. Toute autre valeur signifie qu’une partie du modèle s’exécute sur le processeur central, et que vous mesurez une vitesse qui n’a rien à voir avec celle dont parle cet article.


Vos données : le seul terrain où le match est déséquilibré

Jusqu’ici, ChatGPT gagne presque partout. Ici, l’écart est absolu, et il va dans l’autre sens.

Muse Glimmer n’envoie rien. Une fois les poids téléchargés, tout s’exécute sur votre machine : aucune requête ne sort, aucune connexion n’est nécessaire, aucun quota n’existe, et personne — ni Meta, ni un fournisseur d’accès, ni un tiers — ne peut lire ce que vous écrivez. Ce n’est pas une politique de confidentialité, c’est une propriété physique de l’installation.

Sur le palier gratuit de ChatGPT, l’entraînement sur vos conversations est actif par défaut. La documentation d’OpenAI prévoit que les échanges servent à améliorer les modèles ; l’entreprise collecte par ailleurs l’adresse IP, la localisation et les données de session. La désactivation existe mais elle est manuelle, dans les réglages, section Contrôles des données. Les conversations supprimées peuvent rester jusqu’à trente jours sur les systèmes d’OpenAI. Et le palier gratuit ne comporte aucun accord de sous-traitance, ce qui le disqualifie pour tout usage professionnel touchant des données de clients.

Le contexte européen n’est pas neutre : en janvier 2026, l’autorité italienne de protection des données a infligé 15 millions d’euros d’amende à OpenAI pour traitement illicite de données personnelles.

C’est la vraie ligne de partage entre les deux : avec ChatGPT gratuit, vous payez en données ; avec Muse Glimmer, vous payez en matériel et en lenteur. Nous avions rencontré exactement ce raisonnement à propos d’un modèle servi par un fournisseur qu’on ne pouvait pas nommer : la question n’est jamais seulement « ce modèle est-il bon », mais « où part ce que je lui envoie ».


Ce que Muse Glimmer ne sait pas faire

Les revues indépendantes convergent, et Meta ne les contredit pas.

L’écriture professionnelle, les questions ouvertes et le dialogue restent en retrait des grands modèles propriétaires. Ce n’est pas ce pour quoi il a été conçu : Meta l’a optimisé pour des agents locaux permanents — appel d’outils, mémoire de tâche, reprise après échec.

Les garde-fous sont moins robustes, avec un taux de violation plus élevé en tests adverses. Un modèle qu’on installe soi-même est aussi un modèle que personne ne surveille.

Les capacités multimodales sont décrites comme immatures face aux modèles spécialisés en vision ou en lecture de documents — alors même qu’il embarque un encodeur de perception.

Et il est explicitement déconseillé comme autorité non supervisée pour des décisions financières, juridiques, médicales, de sécurité ou de production. Pour de l’écriture nuancée ou un usage réglementé, un réglage expert est nécessaire.


Le français : ce que Meta dit, et ce qu’il ne dit pas

Meta indique avoir entraîné Muse Glimmer sur des données couvrant plus de cent langues. La même fiche précise, dans le même paragraphe, que le modèle n’a pas été évalué sur l’ensemble de ces langues et que les performances peuvent se dégrader en dehors du sous-ensemble solidement pris en charge.

Meta ne publie ni la liste de ce sous-ensemble, ni la moindre mesure en français.

C’est une formulation prudente, et il faut la lire pour ce qu’elle est : cent langues à l’entraînement ne veut pas dire cent langues garanties. Aucune évaluation comparative publique n’existe à ce jour, ce qui interdit de trancher autrement que par l’usage — et une impression d’usage n’est pas une mesure.


Combien ça coûte vraiment, des deux côtés

Le calcul le plus utile est celui du point d’équilibre, et il donne un résultat contre-intuitif.

Face à ChatGPT gratuit, il n’y a pas de point d’équilibre. Vous ne rentabiliserez jamais un achat de matériel face à un service qui coûte zéro euro. La comparaison financière n’a de sens que face à un abonnement.

Face à ChatGPT Plus, à environ 23 € par mois :

Carte Prix constaté Équivalent en abonnement
RTX 3090 d'occasion ≈ 1 248 $ ≈ 54 mois, soit 4 ans et demi
RTX 4090 d'occasion ≈ 2 268 $ ≈ 99 mois, soit plus de 8 ans
RTX 5090 neuve 4 399 $ et plus ≈ 191 mois, soit près de 16 ans

Et encore : ces durées ignorent l’électricité, le reste de la machine, et le fait qu’en quatre ans et demi le paysage aura changé plusieurs fois.

La conclusion est donc claire : on n’achète pas une carte graphique pour économiser sur ChatGPT. On l’achète parce qu’on veut que rien ne sorte de chez soi, ou parce qu’on fait tourner des agents en continu, ou parce qu’on développe et qu’on a besoin de poids qu’on maîtrise. Trois bonnes raisons — dont aucune n’est le prix.


Ce que dit notre propre classement

Muse Glimmer entre dans une catégorie précise de notre classement IA : celle des modèles exécutables sur une machine locale. C’est là qu’il faut le juger, pas contre les modèles de frontière servis depuis des centres de données.

Une précision honnête sur cette catégorie : elle recense en pratique les modèles qui tiennent sur une machine personnelle, avec une limite de taille. Un modèle de trois cents milliards de paramètres n’y figure pas, quelle que soit sa licence. C’est exactement le terrain de Muse Glimmer — et le seul où la comparaison lui est équitable.

Pour situer l’autre camp, notre comparatif des deux modèles de frontière sortis à un jour d’écart en août montre à quel niveau se joue la course en ligne. L’écart avec le local reste considérable.


L’histoire derrière : Meta a fermé, puis rouvert, en quatre mois

Ce détail change la lecture de l’annonce, et personne ne le relie.

En avril 2026, Meta a publié Muse Spark, son premier modèle propriétaire fermé — la fin de l’ère Llama en poids ouverts, après des années où l’entreprise s’était fait le porte-drapeau de l’IA ouverte. Quatre mois plus tard, en août, elle publie Muse Glimmer sous Apache 2.0, la licence la plus permissive du secteur.

Meta a donc fermé, puis rouvert, en un seul trimestre. Et Muse Glimmer est distillé depuis Muse Spark : c’est le modèle fermé qui alimente le modèle ouvert.

La lecture la plus simple est aussi la plus probable : l’ouvert et le fermé ne sont plus deux camps mais deux étages d’une même gamme — le haut de gamme reste fermé et payant, sa version condensée est offerte pour occuper le terrain. C’est la stratégie que nous avions décrite à propos des modèles chinois distribués gratuitement, appliquée cette fois par un acteur américain.


Lequel choisir selon votre situation

Vous voulez simplement une bonne IA, gratuitement, sans effort. ChatGPT gratuit, sans hésitation. Meilleur, plus rapide, actualisé par la recherche web, aucune installation. Prenez trois minutes pour désactiver l’entraînement dans les Contrôles des données — c’est le seul geste qui compte.

Vous travaillez sur des documents confidentiels. Muse Glimmer, et c’est même la seule réponse honnête des deux. Le palier gratuit de ChatGPT n’a pas d’accord de sous-traitance et entraîne par défaut. Aucun réglage ne remplace le fait que rien ne quitte la machine.

Vous faites tourner des agents en continu. Muse Glimmer, à condition d’avoir 32 gigaoctets de mémoire vidéo. C’est ce pour quoi il a été conçu, ses scores agentiques le confirment, et l’absence de quota devient décisive quand un agent tourne des heures.

Vous avez un Mac ordinaire et vous êtes curieux. Essayez, mais sachez que vous obtiendrez 4,3 jetons par seconde — environ trois mots par seconde. C’est une découverte intéressante, pas un outil de travail.

Vous hésitez à acheter une carte graphique pour ça. Ne le faites pas pour économiser : la moins chère qui convienne équivaut à quatre ans et demi d’abonnement. Faites-le si la confidentialité, l’autonomie hors ligne ou le développement le justifient. Pour situer ce calcul dans le temps long, notre projection sur ce qui attend l’intelligence artificielle dans un, deux et cinq ans montre à quelle vitesse ces arbitrages se périment.


Ce qu’il faut retenir

Non, l’IA locale n’a pas rattrapé le cloud. Muse Glimmer atteint le réglage le plus faible du ChatGPT gratuit, dispose de huit fois moins de contexte, et exige une machine que la plupart des gens n’ont pas. Sur un ordinateur ordinaire, il écrit trois mots par seconde.

Mais la vraie leçon de ce match est ailleurs, et elle tient dans une symétrie : ces deux offres gratuites se paient toutes les deux, simplement pas dans la même monnaie. L’une se paie en données — entraînement par défaut, trente jours de conservation, pas d’accord de sous-traitance. L’autre se paie en matériel et en patience.

Le progrès réel de l’été 2026 n’est donc pas que le local ait rattrapé le cloud. C’est qu’il est devenu, pour la première fois, un choix défendable pour des raisons qui ne sont pas la performance.