98,2% más barato.
La misma frontera
actuación.
MiniMax M3 se lanzó el 1 de junio de 2026 con una ventana de contexto de 1 millón de tokens, multimodalidad nativa y precios que reducen el costo de una ejecución de codificación autónoma. $15.00 a $0.27Analizamos la arquitectura y la economía. He aquí por qué este es el verdadero punto de inflexión para los agentes de IA de producción.
Durante los últimos dos años, la inteligencia artificial se ha sentido como un deporte para espectadores. Cada mes, un gigante tecnológico sube al escenario con un nuevo gráfico que muestra mejoras de puntos decimales en puntos de referencia oscuros. Pero para los ingenieros de software, gerentes de producto y equipos de crecimiento empresarial que construyen actual En cuanto a las aplicaciones, la realidad ha sido una serie de puntos de fricción. Tres, para ser precisos.
- El impuesto de la ventana de contexto — Introducir todo el código fuente o el historial de ejecución en una ventana de 1 millón de tokens ha sido prohibitivamente lento y financieramente ruinoso.
- La separación modal — La interconexión en cadena de modelos de visión y texto separados genera latencia y pérdida de cohesión semántica en el proceso.
- El bloqueo propietario — Las API de código cerrado dejan a las empresas vulnerables a aumentos repentinos de precios, desviaciones de modelos y estrictas restricciones de cumplimiento.
El 1 de junio de 2026, el equilibrio estructural cambió. MiniMax M3 resuelve las tres restricciones simultáneamente.

MiniMax Atención Dispersa — el avance en eficiencia.
El problema fundamental con la atención estándar de Transformer es la complejidad cuadrática: O(N²). Duplicar la longitud de entrada y cuadruplicar el tamaño de la caché KV. MiniMax M3 resuelve esto con MiniMax Sparse Attention (MSA).
En lugar de que cada token haga referencia cruzada a todos los demás tokens en todo el contexto, MSA utiliza una rama de índice ligera que escanea los tokens entrantes y marca solo los bloques semánticamente relevantes de la caché KV. La atención se ejecuta únicamente en esos bloques seleccionados.
Al alcanzar el umbral de 1 millón de tokens, las mejoras en la eficiencia son asombrosas:
En producción, esto produce aproximadamente Salida de 100 tokens por segundo — aproximadamente tres veces más rápido que Claude Opus, a la vez que se preserva la coherencia estructural en todo el contexto de un millón de tokens.
Pesos abiertos que ingresan territorio fronterizo.
| Modelo | SWE-Bench Pro | BrowseComp | Entrada / 1 millón de tokens | Salida / 1 millón de tokens |
|---|---|---|---|---|
| MiniMax M3 | 59,0% | 83,5% | $0.30 (promoción) | $1.20 (promoción) |
| GPT-5.5 | ~56,5% | 81,0% | $5.00 | $15.00 |
| Gemini 3.1 Pro | 54,2% | 80,8% | $1.25 | $5.00 |
| Claude Opus 4.7 | 61,3% | 82,1% | $15.00 | $75.00 |
M3 supera con creces a varios modelos propietarios de gama alta y se acerca bastante a Claude Opus 4.7. En BrowseComp, que prueba el funcionamiento autónomo de la web, un 83,5 % lo sitúa como una opción de élite para la extracción de datos web, la investigación automatizada y las pruebas geográficas.
El estado de pérdidas y ganancias — por ejecución.
Consideremos un flujo de trabajo típico de codificación con agentes: un agente autónomo lee 500.000 tokens de código heredado y genera 100.000 tokens de código refactorizado. Este es el coste real por ejecución:
Para una startup autofinanciada o una empresa que procesa miles de solicitudes de extracción automatizadas diariamente, esta realidad económica transforma a los agentes autónomos de un experimento costoso en un Componente de infraestructura altamente rentable.
El pensamiento parámetro — tres modos de funcionamiento.
M3 introduce una configuración de tiempo de ejecución granular a través de un sistema dedicado. pensamiento parámetro, que permite a los desarrolladores personalizar el comportamiento directamente en la carga útil de la API:
{ "modelo": "minimax/minimax-m3", "mensajes": [ { "role": "usuario", "contenido": "Analiza este rastreo del repositorio y optimiza la memoria CUDA." } ], "pensamiento": "adaptado" } Dónde está MiniMax M3 No es la herramienta adecuada.
- La trampa de quema de fichas - Cuando
pensamiento: habilitadoM3 puede entrar en bucles excesivamente analíticos en casos límite. En simulaciones de estrategias abstractas de póker, se ha observado que gasta miles de tokens de razonamiento argumentando con sus propias premisas internas antes de llegar a una conclusión. - Razonamiento abstracto frente a ejecución concreta — M3 destaca en la ejecución de tareas concretas: traducción de arquitecturas a código, visualización de documentos y llamada a herramientas. Para el razonamiento filosófico abstracto o los enigmas de alta ambigüedad semántica, los sistemas de razonamiento de código cerrado puro siguen teniendo ventaja.
La barrera para lanzar ecosistemas de agentes de IA de grado de producción ha colapsó oficialmente.
MiniMax M3 demuestra que la codificación de vanguardia y los flujos de trabajo autónomos ya no son exclusivos de los conglomerados tecnológicos occidentales cerrados. Al liberar como código abierto un modelo con una ventana de contexto de 1 millón de tokens, multimodalidad nativa y precios que reducen los costos por ejecución en un 98,2 %, MiniMax ha democratizado los componentes básicos de la verdadera autonomía del software.
Para obtener un desglose completo que incluye cinco casos de uso automatizados en acción, vea el video. Tutorial sobre casos de uso reales de MiniMax M3 Abarca la replicación autónoma de la investigación, la depuración del código fuente y los patrones de integración de API.
Ejecuta MiniMax M3 a $0.30/M tokens a través de ai.cc — una clave API.
MiniMax M3 ya está disponible en ai.cc. Sin cuenta independiente, sin configuración del catálogo de API de NVIDIA, sin integración con OpenRouter: solo una clave API compatible con OpenAI para MiniMax M3, Claude Opus 4.8, GPT-5.5, Gemini 3.5 Flash y más de 300 modelos adicionales. Dirige automáticamente cada carga de trabajo al modelo más económico y capaz.
Empieza hoy mismo en www.ai.cc →