MiniMax H3 Max: el stream de IA que banearon de Twitch y Kick
Durante años, generar 15 segundos de video con IA tomaba entre 2 y 5 minutos. Esta semana esa relación se invirtió: ahora se genera video más rápido de lo que uno tarda en verlo. Y lo primero que hizo la comunidad con esa capacidad fue montar un canal de televisión infinito en Twitch… que terminó baneado en cuestión de horas.
En este artículo te explico qué es MiniMax H3 Max, quién lo hizo rápido, qué pasó exactamente con el stream, cuánto cuesta usarlo y qué partes de la historia se sostienen con datos verificables y cuáles no.
📺 Este artículo acompaña al video El stream de IA que banearon de Twitch y Kick (Minimax H3) en el canal.
Resumen rápido (TL;DR)
- MiniMax H3 (también llamado Hailuo 3) es un modelo de video omni-modal de pesos abiertos, publicado el 31 de julio de 2026.
- H3 Max no lo hizo MiniMax: es una versión post-entrenada por fal, anunciada el 26–27 de agosto de 2026, optimizada para velocidad.
- Genera un clip de 5 segundos en menos de 3 segundos (~35x el throughput del endpoint oficial de MiniMax). Pieter Levels lo llamó un momento histórico para la generación de video.
- Rehan Sheikh, ingeniero de fal, lo conectó a un stream de Twitch como "cable interdimensional infinito" (referencia a Rick and Morty). Lo banearon de Twitch, luego de Kick y de Rumble.
- Pieter Levels (@levelsio) construyó Infinite Slop: un canal de TV infinito donde el chat decide qué se genera a continuación. 37,000 personas lo vieron el primer día.
- Precio en fal: $0.08 por segundo a 768p, con 50% de descuento durante el lanzamiento.
Qué es MiniMax H3 (Hailuo 3)
Si sigues el canal, ya me has escuchado hablar de MiniMax, pero en el contexto de modelos de código. Esa es otra familia. Aquí hablamos de su línea de video.
MiniMax H3 —la marca de consumo lo llama Hailuo 3— es un modelo omni-modal: acepta texto, imágenes, clips de video y audio en la misma petición, y devuelve video con audio estéreo nativo sincronizado. Es lo que en el video mencionaba como "puedes pasarle otros archivos y los combina".
Las especificaciones oficiales:
| Característica | MiniMax H3 |
|---|---|
| Publicación | 31 de julio de 2026 |
| Duración de clip | 5 a 15 segundos |
| Resolución máxima | 2K |
| Audio | Estéreo nativo sincronizado |
| Referencias | Hasta 9 imágenes + 3 videos + 3 audios (12 archivos máx.) |
| Arquitectura | H3-Omni-Transformer, 33B parámetros densos |
| Pesos | Abiertos en Hugging Face (MiniMaxAI/MiniMax-H3) |
Lo interesante de su sistema de referencias: no usa sintaxis especial. Escribes "el personaje de la Imagen 2" en lenguaje natural dentro del prompt y el modelo entiende a qué te refieres.
🔗 Documentación oficial de MiniMax
H3 Max: el modelo que hizo posible el stream
Aquí está el matiz que la mayoría de coberturas se salta: H3 Max no es un lanzamiento de MiniMax.
Es una versión post-entrenada por fal Research, la empresa de infraestructura de inferencia, sobre los pesos abiertos de H3. Hicieron dos cosas:
- Post-entrenamiento con datos adicionales enfocados en adherencia al prompt, calidad audiovisual y estética.
- Co-diseño del stack de inferencia, corriendo sobre sistemas NVIDIA GB200 NVL72, en lugar de servir el modelo por una ruta genérica.
El resultado, según las mediciones publicadas por fal:
| Métrica | Valor reportado |
|---|---|
| Clip de 5s a 768p | Menos de 3 segundos |
| Tiempo de denoising backend | ~2.5 segundos |
| Clip de 15s | ~15 segundos |
| Throughput vs. endpoint oficial H3 | ~35x |
| Vs. modelos de calidad comparable | ~15x más rápido |
| Resoluciones | 480p y 768p |
| Modos | Texto a video, imagen a video |
Cada respuesta de la API incluye un campo timings.inference con el tiempo real de denoising, lo cual permite auditar la afirmación en tu propia integración en lugar de creerla a ciegas.
🔗 Anuncio oficial: Introducing H3 Max by fal 🔗 Página del modelo en fal
Precios reales de H3 Max
| Endpoint | Precio |
|---|---|
| H3 Max, 768p | $0.08 / segundo ($4.80 / minuto) |
| H3 Max, promo de lanzamiento (14 días) | $0.04 / segundo |
| MiniMax H3 base en fal, 768p | $0.06 / segundo |
| Tier gratuito | 5 generaciones diarias |
Sin suscripción ni mínimos. Un clip de 5 segundos a precio de lista cuesta $0.40.
El stream que banearon: qué pasó exactamente
Rehan Sheikh (@rehan_shei), ingeniero en fal y ex-CTO de Remade AI, conectó H3 Max a un livestream de Twitch el 29 de agosto de 2026. La idea: cable interdimensional infinito, en referencia directa al episodio de Rick and Morty donde ven televisión de realidades alternas.
El truco es simple y elegante: si el modelo genera un clip de 15 segundos en menos de 15 segundos, puedes encolar generaciones indefinidamente y nunca te quedas sin contenido. El stream se alimenta a sí mismo.
El post original donde anuncia el stream superó las 876,000 visualizaciones. Luego vino la parte incómoda:
- Twitch lo bajó.
- Se mudó a Kick. También lo bajaron.
- Intentó Rumble. Igual.
El propio Rehan lo resumió como que lo estaban baneando de internet, un sitio a la vez.
Importante: ninguna de las tres plataformas publicó una declaración explicando el motivo, y no hay confirmación oficial de la causa. Lo que se sabe viene de los posts del propio creador. Sí hay un antecedente relevante: en 2023, Nothing Forever —la parodia infinita de Seinfeld generada por IA— recibió una suspensión de 14 días en Twitch por contenido generado durante el stream. El patrón sugiere que el problema es la moderación de contenido no supervisado, no la IA en sí, pero eso sigue siendo inferencia, no dato confirmado.
Infinite Slop: la versión que sí sobrevivió
Alguien sugirió en el hilo conectar el chat de Twitch al generador, para que los espectadores pidieran qué ver. Pieter Levels (@levelsio) lo construyó en un día.
Infinite Slop es un canal de TV generado por IA donde lo que escribes en el chat se convierte en el siguiente clip, y el modelo intenta conectarlo con el video anterior para mantener algo parecido a una narrativa. No requiere login. fal patrocina el costo de inferencia.
Datos del primer día:
- 37,000 espectadores.
- Límite técnico: ~4 videos por minuto (4 × 15 segundos), así que en horas pico no todos los prompts entran.
- Levels registró el dominio
InfiniteSlop.aitras el pico de tráfico. - La idea original se acredita a @marcantoinefon y al stream de Rehan.
El nombre es autoconsciente: slop es el término despectivo para contenido generado por IA en masa. Un comentario que circuló en el hilo lo describía como la obra cumbre del slop. Otros lo leyeron como The Truman Show dentro de The Matrix: contenido infinito, personalizado, que se retroalimenta de tus reacciones.
Verificación de datos: qué se sostiene y qué no
Contrasté las afirmaciones que circularon (incluidas las que mencioné en el video) contra las fuentes primarias. Esto es lo que encontré:
| Afirmación | Veredicto | Detalle |
|---|---|---|
| Genera 15s de video en 9 segundos | ⚠️ Aproximado | Esa cifra viene del hilo de levelsio. La medición oficial de fal es ~15s para un clip de 15s, y menos de 3s para uno de 5s. |
| Es 50x más rápido | ⚠️ Depende de la fuente | levelsio dice 50x. fal reporta ~35x vs. el endpoint oficial de H3 y ~15x vs. modelos de calidad comparable. |
| FAL/H3 Max es #1 en Artificial Analysis | ✅ Parcialmente cierto | Es #1 en imagen-a-video con audio (Elo 1202). En texto-a-video con audio es #3 (Elo 1235). |
| Está "muy por encima" de Seedance y Veo | ❌ Impreciso | En i2v, Seedance 2.0 720p está en 1190 vs. 1202 de H3 Max: 12 puntos, no una brecha grande. En t2v los tres primeros están dentro de 6 puntos. Veo 3.1 sí está muy abajo (~#11). |
| FAL post-entrenó el modelo | ✅ Confirmado | fal Research, sobre los pesos abiertos de H3, en NVIDIA GB200 NVL72. |
| Lo banearon de Twitch y Kick | ✅ Confirmado por el creador | También de Rumble. Ninguna plataforma dio motivo oficial. |
| No existe plataforma con streaming de video IA | ❌ Ya no | Infinite Slop está en producción y el canal de Kick de Rehan reapareció. |
Nota metodológica: las cifras de velocidad de fal son auto-reportadas, medidas contra baselines que fal eligió. Al momento de escribir esto no existe una verificación independiente de wall-clock. Los rankings de Artificial Analysis son votos ciegos de usuarios y se mueven semanalmente, así que cualquier "#1" tiene fecha de caducidad corta.
🔗 Leaderboard de texto a video 🔗 Leaderboard de imagen a video
Cómo integrarlo en tu proyecto
Si quieres construir algo parecido —generación bajo demanda, previews rápidos, o tu propio canal infinito— tienes tres rutas:
1. fal (H3 Max)
La opción rápida. Endpoints separados para texto-a-video e imagen-a-video. Recomendaciones de la propia documentación para mantener la latencia baja:
- Quédate en 768p.
- Genera entre 5 y 10 segundos.
- Deja la expansión de prompt en balanced. El modo
fastresponde en ~1 segundo pero pierde calidad de reescritura;qualitypuede gastar hasta 30 segundos solo reescribiendo el prompt.
2. API oficial de MiniMax
Para cuando necesitas 2K, referencias completas (omni-reference) o edición de video. H3 Max no cubre esos casos: está limitado a 480p/768p. El flujo es asíncrono: creas la tarea, haces polling del task_id, y descargas desde content.url.
3. Pesos abiertos
H3 está en Hugging Face bajo la MiniMax H3 Community License. Ojo: los pesos de H3 Max —la variante rápida— no se publicaron junto con el anuncio. fal declaró intención de liberarlos, pero hasta que eso ocurra, la velocidad solo está disponible vía su API.
También agregadores: Vercel AI Gateway (minimax/minimax-h3) y OpenRouter (minimax/hailuo-3). El precio varía hasta el doble según por dónde llames al mismo modelo, así que compara antes de cablear tu integración.
Lo que viene: MiniMax responde
El 29 de agosto —el mismo día del stream— MiniMax anunció su propia variante de inferencia rápida, Fast H3 v1, reclamando ~14x de aceleración sobre hardware NVIDIA Blackwell.
Ese número es auto-reportado, sin baseline nombrado, sin resolución ni número de pasos especificados, y sin benchmark independiente. Tomarlo como una mejora probable a futuro, no como una dependencia sobre la que diseñar hoy.
Qué significa esto para un usuario normal
De momento, poco de forma directa. Pero la línea que se cruzó importa:
Cuando generar es más barato y más rápido que almacenar y servir, el contenido deja de ser un catálogo y pasa a ser una función. No eliges de una biblioteca; pides, y se fabrica.
Las implicaciones prácticas a corto plazo:
- Plataformas de contenido personalizado bajo demanda. No "recomiéndame algo", sino "genérame algo".
- Prototipado publicitario en tiempo real. Revisar 20 variaciones de un anuncio en el tiempo que antes tomaba una.
- Un problema de moderación sin resolver. Los baneos no fueron accidentes: nadie tiene todavía una respuesta buena para moderar contenido que no existe hasta el momento en que se emite.
- Presión de costos. A $0.04–0.08 por segundo, un stream 24/7 cuesta entre $3,400 y $6,900 al día. Por eso Infinite Slop necesita patrocinio. Ese número tiene que bajar mucho antes de que esto sea un producto y no una demo.
Preguntas frecuentes
¿Qué es MiniMax H3 Max?
Es una versión post-entrenada del modelo de video MiniMax H3, desarrollada por fal Research y optimizada para velocidad. Genera clips de 5 a 15 segundos a 480p o 768p con audio nativo.
¿Cuánto cuesta MiniMax H3 Max?
$0.08 por segundo de video a 768p ($4.80 por minuto), con 50% de descuento durante los primeros días de lanzamiento. Incluye 5 generaciones gratuitas diarias.
¿MiniMax H3 es open source?
Los pesos de MiniMax H3 están disponibles en Hugging Face bajo la MiniMax H3 Community License. Los pesos de la variante H3 Max de fal no se han publicado.
¿Por qué banearon el stream de Twitch?
No hay declaración oficial de Twitch, Kick ni Rumble. El creador reportó los baneos públicamente, pero el motivo específico no está confirmado.
¿Puedo ver el stream de IA todavía?
Sí. Infinite Slop sigue activo, no requiere registro, y el chat decide qué se genera a continuación.
¿Se puede generar video en tiempo real hoy?
Sí, con matices. H3 Max genera más rápido de lo que dura el clip resultante, que es el umbral que habilita streaming continuo. No es generación cuadro a cuadro interactiva como un videojuego.
Recursos y enlaces
- Anuncio oficial de H3 Max (blog de fal)
- Página del modelo H3 Max
- Documentación de video de MiniMax
- Infinite Slop
- Leaderboards de video en Artificial Analysis
- Post original de Rehan Sheikh conectando H3 Max a Twitch
- Hilo de levelsio sobre el salto de velocidad
- Post de levelsio anunciando Infinite Slop
¿Estás integrando generación de video en un proyecto y no sabes qué modelo o proveedor elegir? Puedes reservar una asesoría personalizada en fazt.dev.
Y si conoces alguna otra plataforma que ya ofrezca generación de video por streaming, déjala en los comentarios del video y la reviso.
Datos verificados al 30 de agosto de 2026. Los rankings de arenas y los precios promocionales cambian con frecuencia.