Cómo crear videos IA que parecen reales

Resumen

Crear videos realistas de personas con inteligencia artificial que hablen directamente a la cámara es más fácil de lo que crees, y aquí aprenderás el método que hace que nadie note que fueron generados. Es contenido pensado para creadores de redes sociales que buscan videos verticales convincentes sin grabar con celular.

Lo interesante es que el secreto no está solo en el modelo de video, sino en algo que ocurre mucho antes: la imagen de partida.

¿Qué es TikTok Symphony y para qué sirve?

Antes de ir al método principal, vale la pena conocer una herramienta que aparece temprano en la clase: TikTok Symphony [00:39]. Es una plataforma desarrollada por TikTok, diseñada exclusivamente para generar videos verticales de personas, pensada para contenido de creadores.

Su gran ventaja no es la potencia, sino que al crear una cuenta nueva te da una cantidad generosa de créditos para empezar [00:53].

¿Para qué sirve TikTok Symphony? Es una herramienta gratuita de TikTok para generar videos verticales de personas. Funciona bien para acciones simples como moverse o gesticular, pero le cuesta generar audio coherente en español.

¿Qué modos tiene TikTok Symphony?

Dentro de la herramienta encuentras dos modos principales que resuelven necesidades distintas.

  • Modo imagen de referencia [01:22]: subes una imagen, escribes el prompt y la herramienta anima esa imagen. Funciona muy bien para moverse, gesticular o bailar sin hablar.
  • Modo Avatar de voz [02:11]: aquí sí generas videos con diálogo, pero no puedes subir tu propio personaje. Escoges de una biblioteca de avatares predefinidos y ajustas género, estilo y región.

El problema del primer modo es que cuando le pides una persona hablando, el modelo todavía no tiene la inteligencia suficiente para generar audio coherente en español [01:52]. Por eso, para diálogos reales, hace falta otro camino.

¿Cómo hacer que un video de persona con IA se vea realista?

El método correcto empieza por crear la imagen de la persona con tu LLM de preferencia, como ChatGPT [02:53]. Y aquí está la clave que todos pasan por alto: si la imagen de partida ya convence, el video también tiene todas las posibilidades de convencer [05:34].

Hay cuatro elementos que hacen que esa imagen se vea real:

  • El encuadre [03:07]: tiene que sentirse como una selfie, con parte del brazo visible y ligeramente contrapicado, como cuando alguien sostiene un teléfono.
  • El ambiente [03:18]: natural, como un apartamento normal, no un set de fotos.
  • La iluminación [03:23]: natural e imperfecta, sin verse cinematográfica.
  • La expresión [03:34]: mirando directo a la cámara, natural, no posada.

En el ejemplo, se le pidió a ChatGPT un prompt para generar la imagen de una chica colombiana joven con la camiseta de la Selección Colombia, en modo selfie, con parte del brazo visible y un apartamento típico de Bogotá al fondo con iluminación natural [04:10].

¿Por qué la imagen de partida es tan importante en videos con IA? Porque si la imagen ya parece una foto real tomada con teléfono, el video hereda ese realismo. Invertir tiempo en la imagen es lo que evita que se note la IA.

¿Qué modelo de IA genera mejor video con voz en español?

Una vez lista la mejor imagen, la estrategia fue generar el mismo video tres veces con modelos distintos para comparar el realismo [06:16]. Los tres elegidos comparten algo: todos son capaces de generar audio en español.

  • Sidance 2.0 [06:44]: imagen sólida y movimiento fluido, pero falla en la pronunciación. En un momento la palabra golear le sale como golealear. Ese error aparece con palabras que se salen de lo esperado.
  • Kling 3.0 [07:23]: mejora la pronunciación y las palabras salen correctas, pero pierde la energía. El diálogo debería sonar emocionado y suena plano.
  • Google Veo 3.1 [07:56]: para la clase, el mejor. Pronunciación correcta, energía presente y, al revisar cuadro por cuadro, no hay artefactos en la cara ni distorsiones en los bordes que rompan la ilusión.

Ese detalle de revisar el video cuadro por cuadro es lo que separa un resultado creíble de uno que delata la IA.

¿Qué otros ejemplos de video realista funcionan?

Además del caso de la chica hablando a cámara, en la clase se muestran dos escenarios más que amplían las posibilidades [08:30]:

  • Una chica entrevistando a un señor en la calle.
  • Un chico hablándole a la cámara mientras señala algo en su laptop.

Estos ejemplos demuestran que el mismo método sirve para entrevistas, tutoriales y contenido de reacción, no solo para monólogos.

¿Cuáles son las dos claves para un video creíble?

Antes de generar tu propio video, quédate con dos ideas que resumen todo el proceso [08:50].

  1. La imagen de partida. Si ya parece una foto real, el video parte con ventaja. Invierte tiempo ahí.
  2. El encuadre y el ambiente. El encuadre debe verse como una selfie ligeramente contrapicada, con parte del brazo visible. Y el ambiente tiene que ser reconocible y cotidiano.

Ese detalle del brazo visible, aunque parezca menor, hace toda la diferencia entre un video que grita IA y uno que pasa por celular.

Ahora te toca a ti: crea tu propio personaje realista para redes sociales [09:20]. Escoge nacionalidad, estilo, contexto y diálogo; construye el prompt con Claude, ChatGPT, Gemini o la plataforma que prefieras; anima el video en varios modelos y, como es vertical, súbelo directo a TikTok o Instagram. Déjanos en los comentarios el video que generaste.