98,2 % moins cher.
Même frontière
performance.
MiniMax M3 a été lancé le 1er juin 2026 avec une fenêtre de contexte d'un million de jetons, une multimodalité native et une tarification qui réduit le coût d'une exécution de codage autonome. 15,00 $ à 0,27 $Nous avons analysé l'architecture et les aspects économiques. Voici pourquoi il s'agit d'un véritable tournant pour les agents d'IA en production.
Depuis deux ans, l'intelligence artificielle ressemble à un spectacle. Chaque mois, un géant de la tech présente un nouveau graphique illustrant des améliorations minimes sur des benchmarks obscurs. Mais pour les ingénieurs logiciels, les chefs de produit et les équipes de croissance des entreprises qui développent… réel Dans la pratique, la réalité a été une série de points de friction. Trois, pour être précis.
- Taxe de la fenêtre contextuelle — Intégrer un code source complet ou un historique d'exécution dans une fenêtre de 1 million de jetons s'est avéré excessivement lent et financièrement ruineux.
- La séparation modale — L’enchaînement en série de modèles de vision et de texte distincts engendre de la latence et une perte de cohésion sémantique.
- Le confinement propriétaire — Les API à code source fermé exposent les entreprises à des flambées de prix, à des dérives de modèles et à des contraintes de conformité strictes.
Le 1er juin 2026, l'équilibre structurel a basculé. MiniMax M3 résout simultanément les trois contraintes.

Attention clairsemée MiniMax — la percée en matière d'efficacité.
Le problème fondamental de l'attention Transformer standard est sa complexité quadratique : O(N²). Doubler la longueur de l'entrée quadruple l'empreinte du cache KV. MiniMax M3 résout ce problème grâce à Attention parcimonieuse MiniMax (MSA).
Au lieu que chaque jeton fasse référence à tous les autres dans l'ensemble du contexte, MSA utilise une branche d'index légère qui analyse les jetons entrants et ne signale que les blocs sémantiquement pertinents du cache KV. L'attention s'exerce uniquement sur ces blocs sélectionnés.
Au seuil d'un million de jetons, les gains d'efficacité sont stupéfiants :
En production, cela donne environ Sortie de 100 jetons par seconde — environ trois fois plus rapide que Claude Opus, tout en préservant la cohérence structurelle sur l'ensemble du contexte d'un million de jetons.
Entrée en catégorie poids libres territoire frontalier.
| Modèle | SWE-Bench Pro | BrowseComp | Entrée / 1M de jetons | Sortie / 1M de jetons |
|---|---|---|---|---|
| MiniMax M3 | 59,0% | 83,5% | 0,30 $ (promotion) | 1,20 $ (promotion) |
| GPT-5.5 | ~56,5% | 81,0% | 5,00 $ | 15,00 $ |
| Gemini 3.1 Pro | 54,2% | 80,8% | 1,25 $ | 5,00 $ |
| Claude Opus 4.7 | 61,3% | 82,1% | 15,00 $ | 75,00 $ |
M3 surpasse de loin plusieurs modèles propriétaires phares et se rapproche dangereusement de Claude Opus 4.7. Sur BrowseComp — qui teste le fonctionnement autonome du Web — 83,5 % le désignent comme un choix d'élite pour le web scraping, la recherche automatisée et les pipelines de tests GEO.
Le compte de résultat — par exécution.
Prenons l'exemple d'un flux de travail de codage automatisé typique : un agent autonome lit 500 000 jetons de code existant et génère 100 000 jetons de code remanié. Voici le coût réel par exécution :
Pour une startup autofinancée ou une entreprise traitant quotidiennement des milliers de requêtes de fusion automatisées, cette réalité économique transforme les agents autonomes d'une expérience coûteuse en une solution Composante d'infrastructure très rentable.
Le pensée paramètre — trois modes de fonctionnement.
M3 introduit une configuration d'exécution granulaire via un périphérique dédié pensée paramètre permettant aux développeurs de personnaliser le comportement directement dans la charge utile de l'API :
{ "modèle": "minimax/minimax-m3", "messages": [ { "rôle": "utilisateur", "contenu": "Analysez cette trace de dépôt et optimisez la mémoire CUDA." } ], "pensée": "adaptatif" } Où se trouve le MiniMax M3 ? Ce n'est pas l'outil adéquat.
- Le piège de la combustion des jetons - Quand
pensée : activéM3 peut s'enliser dans des boucles suranalytiques sur des cas limites. Dans des simulations de stratégies de poker abstraites, on a observé qu'il dépensait des milliers de jetons de raisonnement à argumenter avec ses propres prémisses internes avant de parvenir à une conclusion. - Raisonnement abstrait contre exécution concrète M3 excelle dans les tâches d'exécution concrètes : traduction d'architectures en code, ingestion visuelle de documents, appel d'outils. Pour le raisonnement philosophique abstrait ou les énigmes à forte ambiguïté sémantique, les systèmes de raisonnement propriétaires conservent un avantage certain.
L'obstacle au lancement d'écosystèmes d'agents d'IA de qualité professionnelle s'est s'est officiellement effondrée.
MiniMax M3 prouve que le codage de pointe et les flux de travail autonomes ne sont plus l'apanage des conglomérats technologiques occidentaux. En proposant en open source un modèle doté d'une fenêtre de contexte d'un million de jetons, d'une multimodalité native et d'une tarification réduisant les coûts par exécution de 98,2 %, MiniMax a démocratisé les fondements d'une véritable autonomie logicielle.
Pour une analyse complète incluant cinq cas d'utilisation automatisés en action, regardez la vidéo. Présentation des cas d'utilisation réels du MiniMax M3 couvrant la réplication autonome de la recherche, le débogage du code source et les modèles d'intégration d'API.
Exécutez MiniMax M3 à 0,30 $/M de jetons via ai.cc — une seule clé API.
MiniMax M3 est désormais disponible sur ai.cc. Aucun compte séparé, aucune configuration du catalogue d'API NVIDIA, aucune intégration OpenRouter : une seule clé API compatible OpenAI suffit pour MiniMax M3, Claude Opus 4.8, GPT-5.5, Gemini 3.5 Flash et plus de 300 autres modèles. Acheminez automatiquement chaque charge de travail vers le modèle compatible le moins cher.
Commencez dès maintenant sur www.ai.cc →