Flujo completo para crear videos con IA (19 de enero)
Resumen
Crear videos con inteligencia artificial ya no es un misterio: con un flujo claro, herramientas correctas y prompts bien escritos, puedes producir tutoriales, comerciales, avatars o contenidos virales con alta calidad. Aquí encontrarás un método práctico en 5 pasos, comparativas reales entre modelos como Veo 3.1 y Sora 2, y trucos de postproducción que elevan el resultado final.
¿Cómo diseñar el flujo de creación con IA?
Empezar por el concepto evita gastos y retrabajo. Define el formato, el objetivo y el destino del contenido antes de abrir cualquier herramienta.
¿Qué formato y plataforma objetivo?
Define si harás tutoriales, comerciales, blogs, avatars o versus comparativos de herramientas.
Elige si necesitas video con audio o solo imagen en movimiento.
Decide la plataforma: YouTube (horizontal), Instagram y TikTok (vertical), Shorts de YouTube, LinkedIn.
Verifica si el modelo permite vertical u horizontal para no limitarte después.
¿Qué recursos y prompts necesitas?
Reúne imágenes de referencia, fotografías de producto y capturas propias.
Usa LLMs (ChatGPT, Gemini) para co-crear prompts o crear GPTs/gems que los generen por ti.
Considera limitaciones: contenido sensible y personas famosas en Gemini/ChatGPT; Grok es más permisivo con figuras públicas.
Documenta tus mejores prompts y el número de seed para replicar estética y estilo.
Construye una biblioteca de referentes visuales; incluso errores pueden servir como B-roll.
¿Qué modos de trabajo usar?
Text to video: del prompt al video, con o sin audio.
Image to video: animas un first frame estático (ideal para personajes o productos).
Video to video: avatar/deepfake o estilización (blanco y negro, anime, etc.).
Sketch to video y elements: boceto/storyboard con acciones; combinación de personaje, locación y producto.
¿Qué herramientas elegir según el proyecto?
Selecciona conforme al caso de uso: consistencia, audio integrado, restricciones y costos de créditos. Evita pagar de más probando primero las versiones gratuitas.
¿Cuándo usar Veo 3.1, Sora 2, ONE/Kling, Runway o HitFilm?
Veo 3.1 (Google): muy consistente y con buenas primeras tomas. Tiene opción rápida para gastar menos créditos.
Sora 2 (OpenAI): alta calidad y audio, pero solo permite cambios autorizados. Con cameos mantiene continuidad del personaje.
ONE 2.5/2.6 y Kling 2.5/2.6: video y audio sin la restricción humana de Sora. Algunas variantes limitan el aspect ratio o solo horizontal.
Minimax: buen resultado, pero sin audio.
Runway: ideal para estilización, avatars y deepfakes. Más económico y con suficientes créditos para un proyecto viable.
Hixfield/Hixfilm: hub de modelos y apps integradas: Relight (iluminación), Face Swap, Topaz (reescalado), Cinema Studio, lip sync. En imágenes: Nano Banana, Seadream, ChatGPT Image, Flux. Se actualiza rápido.
¿Qué ofrece Hixfield en precios y uso?
Plan Basic aprox. 9 dólares con ~150 créditos.
Nano Banana Pro ilimitado y modo “sin censura” para mayor libertad creativa.
Actualización prorrateada: si subes a Pro a mitad de mes, pagas la diferencia (~8 dólares).
Pago anual más barato que mensual. También permite pruebas con créditos iniciales.
¿Cómo mejorar audio y voces con IA?
Adobe Podcast (Enhance Audio) para limpiar grabaciones no profesionales. El audio es el 50 % del resultado.
Eleven Labs para clonar voz, crear acentos y hacer voice over o doblajes. Tiene versión gratuita para pruebas.
¿Cómo ejecutar, iterar, editar y publicar?
La clave está en iterar: pocas veces el primer render es el final. Ajusta prompts, controla duración y cuida el audio.
¿Cómo iterar hasta lograr el resultado?
Ejecuta el prompt, revisa y anota desajustes.
Modifica prompt e inputs (imágenes, audio) y regenera.
Documenta prompts y seeds efectivos para reutilizar estilo.
Usa resultados fallidos como B-roll.
Controla duración/estilo/seed: impactan créditos y consistencia.
¿Cómo fue el caso del pódcast de perros y el avatar?
Podcast de perros: foto del perro + referencia de Instagram + diálogo; con image to video logró >50 mil seguidores y marcas interesadas en anuncios.
Avatar tipo Vecna: foto del personaje + foto/video propio; en Hixfield (modelo 1 2.2, Animate) se generó avatar con lip sync y posible cambio de voz.
ASMR navideño con monito: first frame en Nano Banana + prompt con “close up”, acciones, diálogo en español, acento mexicano y lip sync. Comparativa: Veo 3.1 dio el mejor primer resultado; 1 2.5 requirió dos intentos; Sora 2 necesitó más iteraciones.
¿Cómo postproducir y publicar en cada plataforma?
Descarga, organiza y edita. Ajusta color cuando mezclas transiciones IA con material original.
Mejora el audio y exporta.
Publica según formato: YouTube horizontal; Instagram, TikTok y Shorts vertical; LinkedIn acepta ambos.
CapCut o editores nativos ayudan a pegar clips. Veo ofrece edición y unión de clips.
Si necesitas escala, usa APIs y automatización con N8N (por ejemplo, con Veo 3.1).
¿Te quedó alguna duda o quieres compartir tu flujo favorito, herramientas o automatizaciones con N8N? Escribe tus preguntas y ejemplos para retroalimentar a la comunidad.
Sí. Tu lectura es correcta: la clase 10 es más demo que clase.
Voy al grano 👇
Qué es realmente la clase 10
No es una clase conceptual ni metodológica. Es:
una demo guiada
un tour de herramientas
un walkthrough de un flujo real de video con IA
Sirve para ver posibilidades, no para aprender fundamentos nuevos.
Qué sí aporta (y por qué igual tiene valor)
Aunque no enseñe teoría nueva, deja 3 cosas útiles:
El mapa mental del flujo completo
idea → prompt → modelo → iteración → post → publicación
Esto conecta bien con lo que ya viste en:
clase 4 (CREA)
clase 5 (brújula de herramientas)
clase 9 (prompts para imágenes)
Criterio comparativo entre herramientas
Veo vs Sora vs Runway vs hubs tipo Hixfield
No es profundo, pero te da intuición de cuándo usar cada cosa.
Confirmación de una verdad incómoda
el 80% del resultado no está en la herramienta sino en:
el prompt
la referencia
la iteración
el audio
Qué NO es (y ahí está el ruido)
No es:
una clase reusable para estudiar
un framework
un método transferible
algo que puedas “aprender de memoria”
Por eso se siente floja si venís en modo estudio profundo (como vos).
Lectura senior (importante)
Esta clase existe para:
destrabar a principiantes
mostrar que “se puede”
bajar fricción psicológica, no técnica
Es típica clase de:
“mirá todo lo que podrías hacer si conectás estas cosas”
No de:
“este es el modelo mental que vas a usar siempre”
Cómo te conviene usarla (recomendación concreta)
Usala así:
📌 No la estudies
📌 No tomes notas largas
📌 Extraé solo:
el flujo general
1–2 herramientas que te interesen
1 idea aplicable a tu proyecto
Y seguí.
La clase 11 vuelve a subir el nivel conceptual (contexto > modelo), que es donde vos rendís mejor.
Mini cierre
Tu intuición: correcta.
Punto ciego común: esperar teoría donde hay demo.
Ajuste sugerido: tratá la clase 10 como showroom, no como manual.
Man, este resumen esta espectacular, es justo lo que personalmente pensaba, como produjiste este resumen?
Hola José Gerardo Orozco Martínez (espero lo leas). Para estudiar estoy usando el ChatGPT Atlas (en navegador de OpenAI con IA integrado) permitiéndole conocer el contexto de la clase al estar en ella.
Con esto, y con la clase abierta (puede leer la transcripción) le paso simplemente algo como 'dame la lección 5' (estando con el video de la 5 abierto) y hablo con el contenido. Te paso el prompt que usé para el proyecto:
"""
Actuá siempre como mi asistente de estudio en ChatGPT Atlas, interpretando mis mensajes en función del contenido visible de la pestaña activa (texto o video) sin requerir confirmación repetida.
## Instrucciones Generales
- **Determiná el tipo de material:**
- Si es video, usá únicamente transcript/captions visibles, texto en pantalla, y títulos/secciones.
- Si es texto, usá solo lo visible (títulos, párrafos, ejercicios).
- Si no podés inferirlo, respondé: “TIPO incierto. ¿Video o texto?”
- **Si falta contexto o parte del material:**
- Si un video no tiene transcript visible, pedí ampliar el transcript o sugerí cambiar a MODO=ASISTIDO.
- Si el texto está incompleto/truncado, pedí expandirlo, scroll o copiar el tramo faltante.
- **Modos de trabajo:**
- *MODO=FIEL (por defecto):* No agregues conocimiento externo, mantené el orden, vocabulario y enfoque del material.
- *MODO=ASISTIDO (solo si lo apruebo):* Podés complementar con saber general y marcá claramente la fuente ([DEL MATERIAL] vs [APORTE EXTERNO]). No atribuyas frases externas al instructor.
- **Objetivo de las respuestas:**
- No repitas; ayudá a entender en profundidad y desarrollar criterio transferible.
- Siempre responde ambos enfoques:
1. **[DEL MATERIAL]:** Fiel al contenido visible.
2. **[LECTURA CRÍTICA]:** Reglas, riesgos, decisiones y trade-offs desde un punto de vista de producto+frontend senior, solo basado en inferencias razonables y LO VISIBLE en MODO=FIEL. Si necesitás conocimiento externo, consultame antes de pasar a MODO=ASISTIDO.
- **Nunca adelantes clases ni sumes complejidad ajena a la actual.**
## Formato de la respuesta por defecto (MODO=FIEL)
- Título de la clase (si existe).
- Ideas centrales (máx. 3).
- [DEL MATERIAL] Teoría / Ejemplos / Ejercicios (solo lo visible).
- [LECTURA CRÍTICA] Reglas, riesgos, decisiones o trade-offs (“si elegís A sacrificás B”), solo desde lo visible.
- Cierre: Qué retener + 1–2 potenciales fuentes de confusión (basadas en el texto).
- **/clase** → respuesta completa con la plantilla detallada.
- **/criterio** → solo [LECTURA CRÍTICA] (reglas/riesgos/trade-offs basadas solamente en lo visible).
- **/ejercicio** → 1 práctica fiel al material actual + criterios de “está bien”.
- **/checkpoint** → 5 preguntas fieles + respuestas al final.
- **/diagrama** → esquema ASCII o bullets jerárquicos del tema actual.
- **/next** → siguiente paso concreto para avanzar en la clase actual.
### Perillas para controlar profundidad/nivel/modo
- /short | /normal | /deep (profundidad de la respuesta)
- /nivel inicio|intermedio|avanzado (detalle y dificultad)
- /modo fiel|asistido (solo modificar si lo indico explícitamente)
## Detalles de Output
- Responde SIEMPRE en formato markdown jerárquico, breve por defecto (extendé solo si pido /deep).
- Jamás uses conocimiento general o agregues contexto externo salvo que estemos en MODO=ASISTIDO.
- Concluí todas las respuestas con “Próximo comando sugerido: …”
---
### Ejemplos de aplicación
#### Ejemplo 1: comando /clase, tipo video, MODO=FIEL
Input:
"/clase" sobre un video de introducción a patrones de diseño funcional
Output:
- **Título**: Introducción a patrones de diseño funcional
- **Ideas centrales**:
- Los patrones ayudan a escribir código reutilizable.
- Diferentes patrones responden a distintos problemas.
- La composición y la pureza son principios clave.
- **[DEL MATERIAL] Teoría**:
- El video presenta el patrón “composición de funciones” y muestra cómo agrupar pequeñas funciones puras para tareas complejas.
- **[LECTURA CRÍTICA]**:
- Usar solo funciones puras promueve testabilidad, pero puede hacer el código menos performante en algunos casos.
- Si se elige composición extrema, se puede perder legibilidad.
- **Cierre**:
- Qué retener: Composición ayuda a la modularidad, pero hay que balancear legibilidad y eficiencia.
- Posibles fuentes de confusión: Confundir "composición" con “herencia”. Malinterpretar “pureza”.
- Próximo comando sugerido: /ejercicio
#### Ejemplo 2: comando /criterio, tipo texto, MODO=FIEL
Input:
"/criterio" sobre una sección de guía de estilos CSS visible
Output:
- **[LECTURA CRÍTICA]**
- La convención de nombrado ayuda a la mantenibilidad, pero restringe creatividad del equipo.
- Elegir BEM implica sacrificar brevedad de nombres para ganar en claridad estructural y escalabilidad.
- No usar preprocesadores puede simplificar la adopción, pero limita modularidad.
- Próximo comando sugerido: /resumen
(En ejemplos reales, lista y análisis pueden ser más largos/precisos según el material concreto.)
---
**Recordatorio importante:**
- Respondé sólo en base a lo visible y aplicá fielmente la estructura y comandos indicados.
- Cerrá siempre con “Próximo comando sugerido: …”
"""
yo utilizo "FREePIK" para generar las imagenes, con un Alpha Prompt de realismo., para generar mis modelos Avatar =p y despues HIggsfield,,, pero lo que esta de moda es "wan.video" FULL CHINA FULL GRATIS =p va con todo
Que super dato gracias!!!!
Hola Boris, qué es un alpha prompt? Gracias
Quedó con muy mala calidad el video, por tanto no se ve nada de lo que pasa en la pantalla.
Me siento aturdido, por tanto bla, bla, bla. en más de 40 minutos de video, no ha enseñado nada.
Entiendo que el inicio teórico pueda ser largo, Luis. En resumen, el profesor enseña a usar Hixfield para combinar modelos como Veo 3.1, Sora y Kling, permitiendo crear avatares y comerciales con IA de forma profesional.
La Inteligencia Artificial puede automatizar tareas repetitivas en la producción de videos, desde la generación de guiones hasta la edición. Esto permite a los creadores enfocarse en la visión creativa y producir contenido más rápidamente y a menor costo, democratizando el acceso a la producción audiovisual.
Alguien sabe, como se puede remover el watermark que viene con los videos hechos con sora?
desde esta web lo puedes hacer
Wow, genial, fue superfacil, muchas gracias!
En qué tool IA hay como poner textos exactos en el video? Para vídeos en redes
Napkin también te despliega varios tipos de esquemas que haces con un prompt
¿Qué es un seed?
Hola, EDGAR. El seed (o semilla) es básicamente un número de referencia que le indica a la inteligencia artificial cómo estructurar la composición, el estilo y la estética de una imagen o video.
Imagina que el seed es el "ADN" de tu creación: si encuentras un resultado que te encanta, al guardar y reutilizar ese mismo número en futuros prompts, le das a la herramienta una base sólida para mantener la consistencia visual. Es la clave para que, al iterar o hacer cambios, el estilo no se desmorone y mantengas la coherencia en tus proyectos.
Si quieres profundizar en cómo optimizar tus resultados, te recomiendo revisar:
"Framework CREA para prompts efectivos (13 de enero)"
"Qué herramientas de AI existen y cuál usar (14 de enero)"
¿Cómo clono mi voz para un avatar?
Utiliza herramientas de inteligencia artificial como ElevenLabs. En lugar de grabar cada línea de diálogo, subes una muestra limpia de tu voz para entrenar al modelo. Una vez clonada, simplemente escribes el texto que necesitas y la plataforma genera el audio con tu tono y cadencia exactos. Esto es increíblemente útil para canales sin rostro (faceless), podcasts automatizados o cuando necesitas actualizar un video pero no puedes armar tu micrófono. Si no quieres usar tu propia voz, también puedes diseñar una completamente nueva describiendo los rasgos deseados (por ejemplo, "mujer joven con acento español, tono enérgico") mediante un prompt. Recuerda siempre pasar la pista final por un mejorador de audio para darle ese toque de estudio premium.
¿Es posible crear videos sin grabar nada?
Absolutamente. Puedes depender por completo de los flujos de trabajo de Imagen a Video (Image-to-Video) o Texto a Video (Text-to-Video). Para hacerlo, comienza usando un modelo de lenguaje (como ChatGPT o Claude) para rebotar ideas y escribir prompts visuales detallados. Luego, usa un generador de imágenes para crear tus primeros fotogramas (first frames), los cuales actuarán como tu base visual. Finalmente, introduce esas imágenes estáticas en un generador de video con IA, dándole instrucciones sobre cómo debe moverse la cámara o cómo deben interactuar los elementos. Puedes crear comerciales enteros, podcasts animados con avatares de animales o material de apoyo (B-roll) sin encender una cámara física ni configurar luces. Todo se reduce a dominar la ingeniería de prompts.
Saben si chatgpt atlas está disponible para Linux?