Skip to main content
Claude Fable 5

Claude Fable 5 creó un video completo a partir de un solo prompt

Le di a Claude Fable 5 un solo prompt y obtuve un video de YouTube terminado — guion, voz, avatar, edición. ~380K tokens, ~1 hora, sin grabación. Aquí está el proceso completo.

21 min
Tiempo de lectura
4,174
Palabras
Publicado
Engr Mejba Ahmed

Escrito por

Engr Mejba Ahmed

Compartir Artículo

Claude Fable 5 creó un video completo a partir de un solo prompt

Claude Fable 5 creó un video completo a partir de un solo prompt

Escribí un prompt. No escribí un guion. No grabé un solo segundo de audio. No abrí HeyGen, ElevenLabs ni un editor de video. No toqué ffmpeg. Aproximadamente una hora después, un video de YouTube terminado y listo para subir estaba en mi carpeta de salida — narrado con mi propia voz, con un avatar que se movía como yo, y con motion graphics que aparecían exactamente en la palabra indicada.

El modelo que hizo todo esto fue Claude Fable 5, el nuevo modelo de clase Mythos de Anthropic que se hizo disponible de forma general el 9 de junio de 2026. Y lo que sigo pensando tres días después no es lo bien que se ve el video. Es que todo el pipeline de producción — la parte que solía orquestar manualmente a través de tres o cuatro herramientas — se colapsó en una sola instrucción dada a un modelo que simplemente... ejecutó todo.

He estado construyendo pipelines de video con IA durante meses. Sé exactamente cuánto código de conexión, lógica de fragmentación y supervisión normalmente requiere. Así que cuando digo que esta ejecución fue diferente, no estoy reaccionando a un demo. Estoy reaccionando a ver cómo un modelo realizó, de forma autónoma, el trabajo de orquestación que yo había escrito previamente a mano y descrito en detalle en mi build del pipeline de video HeyGen + ElevenLabs + Claude Code. Este artículo es el relato honesto de esa ejecución — lo que costó, lo que realmente hizo, dónde no es determinista, y dónde yo mantendría la mano en el volante.

Qué significa realmente "clase Mythos" ahora

Permíteme anclar el modelo antes del video, porque el nivel de capacidad es toda la historia.

Durante la mayor parte del último año, "Mythos" fue un rumor y luego una filtración. Escribí sobre ello cuando Anthropic expuso accidentalmente el modelo bajo el nombre en código Capabra — los detalles completos están en mi análisis de la filtración de Claude Mythos. En ese momento, Mythos era un nivel por encima de Opus que casi nadie podía tocar. Estaba restringido a un pequeño grupo de socios de seguridad verificados y ciberdefensores.

Eso cambió el 9 de junio. Anthropic lanzó Claude Fable 5 como el modelo de clase Mythos disponible públicamente — el mismo nivel de capacidad subyacente, con scaffolding de seguridad para la versión general. (La variante completamente desbloqueada, Claude Mythos 5, sigue restringida a un grupo reducido de socios de infraestructura y seguridad.) Según el lanzamiento de Anthropic, Fable 5 está disponible hoy en la API y en planes Enterprise basados en consumo, y se incluyó en los planes Pro, Max y Team sin costo adicional hasta el 22 de junio.

Esto es lo que ofrece el nivel, y por qué importa para una tarea de horizonte tan largo como hacer un video:

  • Programación a una escala que no he visto antes. El anuncio de Anthropic describe cómo Fable 5 ejecuta una migración completa en una base de código Ruby de aproximadamente 50 millones de líneas en un solo día — trabajo que la empresa enmarca como algo que normalmente toma más de dos meses a un equipo. No puedo reproducir esa afirmación personalmente; no tengo un monolito Ruby de 50M líneas por ahí. Pero te indica qué tipo de trabajo sostenido y de múltiples pasos puede mantener el modelo sin perder el hilo.
  • Visión que reconstruye, no solo describe. Puede reconstruir el código fuente de aplicaciones web a partir de capturas de pantalla, y Anthropic mostró cómo jugaba Pokémon Rojo Fuego desde píxeles crudos de pantalla sin ayudas de navegación.
  • Memoria de horizonte largo. Esta es la que realmente hace posible el video. Fable 5 usa memoria basada en archivos — se escribe notas, las relee y mantiene su posición a lo largo de una tarea larga. Anthropic informa que alcanza el acto final de Slay the Spire aproximadamente tres veces más a menudo que su predecesor, Opus 4.8. Una producción de video es exactamente ese tipo de maratón: docenas de pasos dependientes donde olvidar el paso 4 arruina el paso 19.

Ese mecanismo de memoria merece más que una viñeta, porque es la diferencia entre "demo interesante" y "esto realmente terminó." Una ejecución completa de video no cabe en una sola ventana de contexto — ni siquiera en una de 1M tokens. Para cuando el modelo está renderizando motion graphics en la fase cuatro, el guion que escribió en la fase uno y las decisiones de fragmentación de la fase dos están miles de pasos atrás. Las cosas tan lejanas se comprimen, resumen o empujan fuera de la ventana activa por completo. Con un modelo normal, ahí es donde las cosas se descarrilan: olvida que la tarjeta estadística debía aparecer en la palabra "cincuenta millones," o re-deriva una longitud de fragmento que ya había establecido, y el timing se desfasa.

Fable 5 evita eso tratando el sistema de archivos como memoria en lugar de depender solo de la ventana de contexto. Observando sus logs, podía ver cómo literalmente escribía notas entre fases — un archivo continuo de decisiones como qué fragmentos de audio correspondían a qué clips de avatar, cuáles eran las duraciones objetivo, qué gráfico se disparaba en qué marca de tiempo. Luego, fases después, releía esas notas en lugar de intentar recordar. Es el mismo truco que usa un editor humano: no mantienes toda la lista de decisiones de edición en la cabeza, mantienes un archivo de proyecto y lo consultas. El modelo externalizó su propio estado para que el horizonte largo dejara de ser un problema de memoria y se convirtiera en un problema de búsqueda. Para cualquier cosa multifase — no solo video, sino cualquier trabajo agéntico que se ejecute más allá de lo que una sola ventana de contexto puede contener — esa es la capacidad que importa más que el throughput bruto de tokens.

La etiqueta de precio es la parte que no puedes ignorar. Fable 5 funciona a aproximadamente $10 por millón de tokens de entrada y $50 por millón de tokens de salida — menos de la mitad de lo que costaba el Mythos Preview, pero aún así el modelo frontier más caro en circulación general ahora mismo. Recuerda ese número. Se convierte en toda la conversación de "¿deberías hacer esto?" al final de este artículo.

Ese es el motor. Ahora la ejecución.

El prompt que reemplazó todo mi pipeline

La configuración que le di fue deliberadamente perezosa, a propósito. Quería ver cuánto podía no hacer.

Apunté Fable 5 al anuncio de lanzamiento de Fable 5 de Anthropic y le pedí que hiciera un video de YouTube explicando la versión — con mi voz, mi formato, listo para subir. Le di un playbook de voz (más sobre eso abajo), mi contexto de marca, y una regla dura que seguiré repitiendo: no pares hasta que estés 100% seguro de que el resultado es de alta calidad. Esa frase hizo más trabajo que cualquier otra línea del prompt.

Luego lo dejé funcionar.

Lo que hizo después es la parte que reorganiza cómo pienso sobre la "generación de video con IA." No generó un video como lo hace un modelo de texto a video — no hubo un solo render mágico. En su lugar, ejecutó una producción real, el mismo pipeline de cinco etapas que yo normalmente manejaría a mano, excepto que yo no estaba al mando. Aquí está la secuencia que ejecutó.

1. Escribió el guion — y primero verificó los hechos

Antes de escribir una palabra de narración, Fable 5 leyó el anuncio completo de Anthropic y verificó las afirmaciones contra él. Luego escribió el guion con mi voz — no una voz genérica de "explicador de IA", sino la mía, extraída de un playbook de voz que había ensamblado a partir de transcripciones de mis videos anteriores. El ritmo de las frases, la forma en que abro con un número, mi hábito de decir "aquí está la parte que importa" — captó todo eso.

Este es el primer punto donde el nivel Mythos justifica su precio. La generación de guiones de video que mantiene una voz consistente a lo largo de una pieza larga es en realidad una tarea de largo horizonte disfrazada. Los modelos más débiles derivan — el párrafo tres suena como un escritor diferente al párrafo ocho. Fable 5 se mantuvo en personaje todo el camino porque literalmente estaba tomando notas sobre sus propias decisiones de estilo en la memoria basada en archivos mientras avanzaba.

2. Sintetizó la voz en fragmentos para evitar la deriva

El guion terminado fue a ElevenLabs para el audio a través de mi clon de voz. Y aquí hay un detalle que encuentro silenciosamente impresionante: no volcó todo el guion en una sola llamada a la API. Segmentó la narración en fragmentos de justo menos de un minuto antes de enviarlos.

Eso no es arbitrario. Los clones de voz instantáneos de ElevenLabs se vuelven menos consistentes cuanto más se aleja la solicitud del material de referencia y cuanto más larga es la generación continua — la cadencia se aplana, aparecen artefactos. Aprendí esto por las malas hace meses y codifiqué ~45–60 segundos de fragmentación en mi pipeline manual. Fable 5 llegó a la misma restricción por su cuenta y fragmentó a aproximadamente la misma longitud. Entendió el modo de fallo de la herramienta downstream sin que yo lo especificara.

3. Animó el avatar con HeyGen Avatar 5

Cada fragmento de audio fue a HeyGen, renderizado con el último motor de movimiento Avatar 5. Avatar 5 construye un gemelo fotorrealista a partir de tan solo un clip de 15 segundos y es la versión que finalmente corrigió el aspecto "plástico" — movimiento más natural de cabeza y cuerpo, sincronización labial más precisa, micro-expresiones reales.

Hubo un detalle genuinamente interesante de autonomía aquí. En mis pruebas anteriores, Avatar 5 no estaba completamente expuesto a través de la API pública de HeyGen, así que tuve que automatizar un navegador con Playwright para acceder a él. Fable 5 manejó la brecha equivalente conduciendo la automatización del navegador él mismo cuando la ruta de API era limitada — y ahora que HeyGen soporta el motor más nuevo más directamente, cambió a la llamada directa. Se adaptó a la superficie de integración en lugar de fallar en ella.

4. Editó y construyó cada motion graphic en código

Aquí es donde dejó de ser "pegar unos clips" y se convirtió en edición real.

Fable 5 usó ffmpeg para unir los clips de avatar. Pero los gráficos son la parte en la que quiero que te detengas: construyó cada motion graphic como animaciones HTML codificadas con GSAP (GreenSock — seguía llamándolo "Gap" en sus propios logs, lo cual me hizo reír) dentro de Hyperframes, el framework de renderizado open-source de HeyGen. Si quieres la versión profunda de esa capa específica, documenté su construcción desde un solo prompt en mi tutorial de motion graphics con Hyperframes desde un prompt — Fable 5 hizo lo mismo aquí, pero como una fase dentro de una tarea autónoma más grande.

Los gráficos no eran decorativos. Estaban sincronizados con las palabras habladas — una tarjeta estadística apareciendo en el instante en que la narración mencionaba el número, una etiqueta aterrizando en el término mientras yo lo "decía." Para lograrlo, el modelo renderizó frames, los revisó, detectó sus propios errores de timing y renderizado, y corrigió hasta alcanzar el umbral de calidad. Estaba haciendo QA visual de su propia salida.

5. Verificó todo con QA multi-agente

La última fase fue un flujo de trabajo dinámico multi-agente: levantar agentes para tomar capturas de pantalla del resultado renderizado, verificar visualmente que el contenido coincidiera con el guion, comprobar que los gráficos se dispararan a tiempo, y confirmar que nada se hubiera roto. Solo después de esa revisión declaró el video terminado.

El resultado fue un video de YouTube completamente verificado y listo para subir. Lo vi de principio a fin antes de tocar nada. Era genuinamente bueno.

Lo que realmente costó: el recibo de tokens y dólares

Prometí que el precio volvería. Aquí está, con números reales de la ejecución.

Toda la producción — del guion al video terminado — consumió aproximadamente 380.000 tokens. El flujo completo se ejecutó en alrededor de una hora. Y en términos de presupuesto del plan, consumió aproximadamente el 40% de un plan de $200/mes en esa sola ejecución.

Déjame traducir eso, porque las cantidades de tokens son abstractas y los dólares no. A la tarifa de Fable 5 de $10 por millón de entrada y $50 por millón de salida, una ejecución autónoma de video de una hora no es un error de redondeo. Si produces un video flagship por semana, el costo del modelo es real pero defendible. Si intentas producir volumen diario de esta manera, lo sentirás rápido — y querrás pensar seriamente sobre qué etapas realmente necesitan razonamiento de clase Mythos y cuáles podrían ejecutarse en un modelo más barato.

Aquí está la valoración honesta a la que llegué:

  • Ganancia rápida: Los ahorros de mano de obra son inmediatos y enormes. El tiempo humano después de "adelante" fue efectivamente cero. Sin grabaciones, sin sesión de edición, sin rondas de revisión. Solo eso cambia la economía de cualquier operación de contenido que publica video regularmente.
  • El costo real: Es computación, no mano de obra. Has cambiado la factura de un editor y cuatro horas de tu propio tiempo de grabación por una factura de tokens y un modelo que es el más caro del mercado. Para trabajo profesional de alto valor o alto volumen, ese intercambio es una ganga. Para un canal de hobby que publica ocasionalmente, es excesivo — quemarás presupuesto del plan más rápido de lo que lo recuperarás.

Déjame hacer concreto el costo por video, porque "40% de un plan" solo significa algo si haces la multiplicación. Una ejecución fueron ~380K tokens y ~40% de un plan de $200/mes, lo que sitúa el costo efectivo de ese único video en aproximadamente $80 de presupuesto del plan. Ejecútalo con precios de API crudos y la forma es similar: 380K tokens sesgados hacia salida a $10/M de entrada y $50/M de salida aterriza en el mismo rango de aproximadamente $15–$25 en inferencia pura si la mayoría de esos tokens son salida, antes de contar los reintentos y pases de QA que no siempre aparecen en una estimación limpia. De cualquier forma, calcula decenas de dólares por video terminado, no centavos.

Ahora escálalo. Un video flagship por semana son aproximadamente 1,6M tokens al mes — cómodamente dentro de un plan de $200 con margen de sobra, y una decisión obvia frente a lo que cobra un editor. Sube a un video por día y estás en ~11,4M tokens al mes solo de esta etapa; habrás agotado un solo plan de $200 en aproximadamente dos ejecuciones y estarás pagando tarifas de API por el resto. A tres videos por día para un equipo de contenido, la factura del modelo deja de ser una nota al pie y se convierte en una partida que alguien tiene que defender en una reunión de presupuesto. Esa es la verdadera frontera de decisión: Fable 5 de punta a punta es magnífico para producción de bajo volumen y alto valor, y se encarece rápido en cuanto "autónomo" se convierte en "siempre encendido."

Si quieres una configuración optimizada para mantener ese costo bajo — eligiendo dónde gastar razonamiento de modelo frontier y dónde bajar a algo más barato — ese es exactamente el tipo de trabajo de arquitectura de pipeline que hago a través de mi Fiverr. La lógica de orquestación es donde se ahorra o se desperdicia el dinero.

Esa es la matemática. Ahora la parte que los demos de lanzamiento no te cuentan.

La verdad: dónde falla y en qué no confío todavía

Te haría un flaco favor si me detuviera en "hizo un video y quedó genial." Tres cosas de esta ejecución merecen tu escepticismo.

No es determinista, y eso es más importante de lo que parece. Ejecuté el mismo prompt de nuevo para ver si obtendría el mismo video. No lo obtuve. Ni de cerca en algunos puntos. El propio encuadre de Anthropic reconoce esto: repetir un prompt idéntico puede no reproducir la salida, en parte porque el sistema depende de habilidades y flujos de trabajo preexistentes que no están completamente expuestos o fijados. Para una pieza creativa única, bien. Para un proceso de producción repetible que quieres ejecutar cien veces con resultados consistentes, el no-determinismo es un riesgo operacional real. Todavía no puedes tratar esto como un script de compilación determinista. Lo tratas como un contratista muy rápido y muy capaz que hace trabajo excelente ligeramente diferente cada vez.

"Autónomo" todavía necesita una compuerta de calidad humana. La salida pasó la propia QA del modelo. Aun así recibió mi revisión antes de que la hubiera publicado. La verificación multi-agente es genuinamente buena — atrapa renders rotos y fallos de timing — pero "el modelo está 100% seguro" y "esto representa mi marca como yo quiero" no son el mismo estándar. Ese umbral de confianza en el prompt es lo que produjo resultados profesionales; no es un sustituto de la última mirada humana.

El conocimiento de fragmentación y herramientas viene incorporado, y eso corta en ambas direcciones. Parte de por qué esto funcionó tan bien es que el modelo ya "sabía" cosas como el problema de deriva de ElevenLabs y el flujo de renderizado de Hyperframes. Eso es genial hasta que tus herramientas cambian. Cuando ElevenLabs o HeyGen lanzan una actualización que rompe compatibilidad, un flujo incorporado puede hacer con confianza lo antiguo. El lado positivo: la metodología no está atada a Fable 5. El mismo enfoque de pipeline se adapta hacia abajo a un modelo como Sonnet para las etapas que no necesitan razonamiento frontier — y así es exactamente como domarías el costo.

Lo que realmente tuve que supervisar. "Autónomo" se lee más limpio en un titular de lo que se sintió en la práctica. El no-determinismo no fue una advertencia abstracta — me mordió. Mi segunda ejecución se desvió: reestructuró el guion en un orden diferente y re-temporizó gráficos que habían aterrizado perfectamente la primera vez, así que la versión pulida de la primera ejecución no era algo que pudiera simplemente regenerar bajo demanda. Tuve que conservar la buena salida, no confiar en que el proceso la recrearía. La brecha de HeyGen fue la otra arista áspera. Como Avatar 5 no estaba completamente accesible a través de la API pública en mis pruebas anteriores, el modelo recurrió a conducir un navegador para hacer el render — y la automatización de navegador contra una aplicación web en vivo es exactamente esa capa frágil, lenta, de "¿se movió el botón?" que no quieres en un pipeline desatendido. Funcionó, pero es el tipo de cosa que se rompe silenciosamente cuando cambia el markup del sitio, y es por lo que vigilé esa fase en lugar de irme. El soporte nativo que llegó para el motor más nuevo es lo que permitió cambiar a la llamada directa más limpia, y eso es un recordatorio de cuánta de esta "magia" descansa en superficies de integración que el modelo no controla.

Una nota honesta más: la palanca más grande en toda la ejecución no fue la potencia bruta del modelo. Fue ingeniería de prompts con propósito — darle contexto claro, un playbook de voz real, y un estándar de calidad explícito y no negociable. La instrucción "detente solo cuando estés 100% seguro de alta calidad" hace trabajo pesado. Dale a Fable 5 un prompt vago y obtendrás un video vago y caro. El modelo recompensa la precisión en proporción a su precio.

¿Entonces deberías hacer esto realmente?

Aquí está mi lectura directa después de vivir con la salida durante unos días.

Si publicas video a volumen profesional — lecciones de cursos, explicadores de productos, un canal de contenido con cadencia real — Claude Fable 5 cambia tu matemática de producción hoy. No el próximo año. El cuello de botella al que había estado dedicándome durante meses, donde un humano todavía tenía que orquestar las herramientas incluso después de que la IA hiciera las partes difíciles, se ha movido. Un modelo ahora sostiene todo el pipeline.

Si haces un video ocasional por diversión, esto es un magnífico exceso. Usa la versión más barata y construida a mano en su lugar — y francamente, sigue filmando las cosas que genuinamente son . Todavía grabo mis videos personales de YouTube yo mismo. Este pipeline es para contenido escalable, no para las cosas donde mi presencia real y sin ensayar es el punto.

La frontera que esta ejecución marca realmente no es "la IA puede hacer videos." Hemos tenido texto-a-video mediocre durante dos años. La frontera es un prompt, de punta a punta, completamente autónomo, salida profesional — guion, voz, avatar, edición y auto-QA, con un humano que no escribe nada más que el brief. Eso es nuevo. Y apunta a algo más grande: creación multimedia con IA cada vez más autónoma donde el rol humano se comprime a dirección y juicio, y todo entre la intención y el archivo terminado lo maneja un modelo que toma sus propias notas y revisa su propio trabajo.

Preguntas frecuentes

¿Qué es Claude Fable 5?

Claude Fable 5 es el primer modelo de clase Mythos disponible públicamente de Anthropic, lanzado el 9 de junio de 2026 — un nivel de capacidad por encima de Claude Opus 4.8. Cuenta con una ventana de contexto de 1M tokens, memoria de horizonte largo basada en archivos y un sólido rendimiento en visión y programación, con un precio de $10 por millón de tokens de entrada y $50 por millón de tokens de salida.

¿Puede Claude Fable 5 realmente hacer un video completo desde un prompt?

Sí — en mi prueba produjo un video de YouTube completo y listo para subir a partir de un solo prompt, orquestando su propio pipeline: generación de guion, síntesis de voz con ElevenLabs, animación con HeyGen Avatar 5, edición con ffmpeg, motion graphics con GSAP en Hyperframes, y QA visual multi-agente. La salida no es determinista, así que ejecutar el mismo prompt de nuevo no reproducirá el mismo video.

¿Cuánto cuesta producir un video con Claude Fable 5?

Mi ejecución de una hora usó aproximadamente 380.000 tokens y consumió alrededor del 40% de un plan de $200/mes. A $10/$50 por millón de tokens de entrada/salida, es rentable para video profesional de alto valor o alto volumen, pero caro para uso ocasional o de hobby. Los ahorros vienen de eliminar la mano de obra de grabación y edición, no de computación barata.

¿Este pipeline de video solo funciona con Claude Fable 5?

No. La metodología se adapta a otros modelos, incluyendo Claude Sonnet, para las etapas que no requieren razonamiento de nivel frontier. Para la construcción manual completa, consulta mi guía del pipeline HeyGen + ElevenLabs + Claude Code arriba — Fable 5 automatiza la orquestación que de otro modo tendrías que ensamblar tú mismo.

¿Por qué la salida de video de Claude Fable 5 no es determinista?

Ejecutar el mismo prompt produce videos diferentes porque el modelo depende de habilidades y flujos de trabajo preexistentes que no están completamente fijados o expuestos, más varianza inherente de generación. Para producción repetible a escala, ese no-determinismo es un riesgo operacional que debes planificar en lugar de ignorar.

Trabajemos juntos

¿Quieres construir sistemas de IA, automatizar flujos de trabajo o escalar tu infraestructura tecnológica? Me encantaría ayudarte.

Publicidad
Coffee cup

¿Te gustó este artículo?

Tu apoyo me ayuda a crear más contenido técnico detallado, herramientas de código abierto y recursos gratuitos para la comunidad de desarrolladores.

Temas Relacionados

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 10+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Discussion

Comments

0

No comments yet

Be the first to share your thoughts

Leave a Comment

Your email won't be published

11  +  7  =  ?

Artículos Relacionados

Ver Todos

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

Claude Code Expert · Online

👋

Hey there!

Quick Actions

WhatsApp Instant reply

Chat on WhatsApp

+880 1723 741224 · Instant reply

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

[email protected]

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support