Saltar al contenido

Glosario esencial de video generado con IA

Darius Z. Por Darius Z. Actualizado: 12 min de lectura
Tarjetas con términos técnicos ordenadas sobre un escritorio

Ideal para: marketers de producto, equipos operativos, agencias e influencers que necesitan un glosario rápido mientras guionizan contenido con IA.

Novedades de 2026: este glosario se amplió en septiembre de 2026 con quince términos sobre cómo funcionan los modelos y cómo se regula el contenido de IA: etiqueta de contenido de IA, DAW con IA, C2PA, créditos, umbral de indistinguibilidad, control de movimiento, audio nativo, resolución 4K nativa, pesos abiertos, generación en tiempo real, entradas de referencia, Sora, storyboard, SynthID y modelo multimodal unificado.

A

Audio Inpainting

Uso de IA para rellenar huecos, eliminar sonidos no deseados o reparar secciones dañadas de grabaciones de audio manteniendo un flujo natural.

Audio nativo

El modelo genera diálogos, efectos de sonido y música en la misma pasada que los píxeles, en lugar de añadir una pista de voz después. Kling 3.0 (febrero de 2026) lo hace en cinco idiomas; Hailuo 3.0 devuelve audio estéreo en clips de 2K y 24fps.

Avatar de IA

Presentador digital generado por IA que interpreta tu guion y puede reemplazar a actores humanos.

Animación labial (Lip-sync)

Tecnología que alinea los movimientos de la boca con el audio sintetizado para que el avatar se vea natural.

Aspect ratio

Relación entre ancho y alto del video (16:9 horizontal, 9:16 vertical, etc.).

B

Borrado de fondo

Herramienta que elimina automáticamente el fondo real para colocar escenarios generados.

Generación por lotes

Crear varios videos al mismo tiempo a partir de plantillas o scripts diferentes.

Brand kit

Paquete de logos, tipografías y colores que mantiene la identidad visual en cada video.

C

C2PA (Content Credentials)

Estándar abierto que adjunta metadatos de procedencia que registran que un archivo fue generado por IA y con qué herramienta. Invisible para un espectador casual. Google lo incluye en las salidas de Gemini incluso cuando la marca de agua visible está desactivada; Synthesia lo incluye por defecto. Más en el interruptor de marca de agua de Gemini.

CFG Scale (Classifier-Free Guidance)

Parámetro que controla cuán fielmente la IA sigue tu prompt. Valores altos producen resultados más fieles; valores bajos permiten más libertad creativa.

Checkpoint

Estado guardado de los pesos entrenados de un modelo de IA. Diferentes checkpoints pueden producir distintos estilos visuales o capacidades.

Clonación de voz

Proceso que replica tu timbre y ritmo tras grabar un muestreo guiado.

Control de movimiento

Dirigir a un personaje generado con un video de referencia de una actuación real para que el resultado copie el movimiento. Kling VIDEO 2.6 (diciembre de 2025) acepta referencias de 3 a 30 segundos y sigue el cuerpo completo, las manos y la expresión facial.

ControlNet

Técnica que proporciona control preciso sobre la generación de imágenes y video con IA usando imágenes de referencia para poses, bordes, mapas de profundidad u otras guías visuales.

Créditos

La unidad de facturación que usan la mayoría de generadores; cada clip cuesta una cantidad de créditos que sube con la resolución y la duración, así que un plan mensual es en realidad un presupuesto mensual de segundos. Por ejemplo, Runway cobra Hailuo 3.0 a 15 créditos por segundo de video en 2K.

Avatar personalizado

Modelo entrenado con tu imagen o la de un vocero para tener una versión digital propia.

D

DAW con IA

Estación de trabajo de audio digital en el navegador con generación integrada, de modo que prompts, stems, MIDI y mezcla conviven en un solo proyecto. Suno Studio 2.0 (13 de agosto de 2026) añadió grabación y edición de MIDI, un colaborador de chat con IA y plugins personalizados, y permite que los clips MIDI funcionen como prompts.

Deepfake

Video manipulado que suplanta la identidad de una persona real; puede ser ético o malicioso según el uso. Desde el 2 de agosto de 2026, las normas de la UE exigen que los deepfakes lleven una etiqueta visible de IA (ver etiqueta de contenido de IA).

Modelo de difusión (Diffusion Model)

La arquitectura de IA que impulsa generadores de video modernos como Kling, Veo y Runway (Sora se discontinuó en marzo de 2026). Funciona aprendiendo a eliminar ruido de estática aleatoria hasta que emerge una imagen o video coherente.

Humano digital

Otro nombre para un avatar hiperrealista que luce y actúa como una persona.

Doblaje

Reemplazar el audio original por otro idioma manteniendo sincronía de labios y gestos.

E

Casos extremos

Situaciones poco comunes (acentos raros, nombres técnicos) donde la IA puede fallar.

Formato de exportación

Tipo de archivo final (MP4, MOV, WebM) que eliges al descargar el video.

Entradas de referencia

Imágenes, clips o audio que se aportan junto con el prompt para que el modelo mantenga coherente a un personaje, objeto o escenario. Google Veo 3.1 lo llama “Ingredients to Video”; Hailuo 3.0 acepta hasta 12 archivos de referencia por generación (como máximo 9 imágenes, 3 clips de video y 3 clips de audio).

Etiqueta de contenido de IA

Aviso visible de que un video, imagen o archivo de audio fue generado por IA. El Artículo 50 de la AI Act europea y la SB 942 de California se aplican desde el 2 de agosto de 2026; la UE además exige marcado legible por máquina (con plazo el 2 de diciembre de 2026 para los sistemas ya en el mercado) y multas de hasta 15 millones de euros o el 3% de la facturación. Más en la cobertura de la AI Act de la UE.

F

Fine-tuning (Ajuste fino)

El proceso de tomar un modelo de IA preentrenado y entrenarlo más con datos específicos para especializarlo en una tarea, estilo o tema particular.

Reemplazo de rostro

Tecnología que cambia la cara de un actor por la de otra persona dentro del video.

Fotogramas por segundo (FPS)

Cantidad de imágenes mostradas cada segundo; 24‑30 fps es el estándar.

Frontend / Backend

Frontend es lo que ve el usuario; backend es el motor de IA que procesa voz, video y guion.

G

Generación en tiempo real

Producir un clip en menos tiempo real del que dura el propio clip. LTX-2.5 generó un clip de 720p y 10 segundos en 6.8 segundos sobre hardware NVIDIA GB200.

IA generativa

Modelos capaces de crear contenido nuevo (imágenes, voz, video) en lugar de solo analizar datos.

Control de gestos

Capacidad de definir movimientos de manos o cuerpo para que el avatar comunique mejor.

Pantalla verde virtual

Fondo liso que permite exportar al avatar con transparencia para componer sobre otra escena.

H

Alucinación (Hallucination)

Cuando la IA genera contenido falso, sin sentido o factualmente incorrecto. En video, puede aparecer como manos distorsionadas, física imposible o rostros que se deforman de manera antinatural.

Hiperrealista

Contenido generado que resulta casi indistinguible de una grabación real. Cuando los espectadores ya no pueden notarlo en absoluto, el resultado ha cruzado el umbral de indistinguibilidad.

HeyGen

Plataforma popular de video con avatares y clonación de voz lista para empresas.

I

Imagen a video (img2vid)

Generación de contenido de video a partir de una sola imagen estática. La IA anima la imagen estática, añadiendo movimiento, movimientos de cámara o animación de personajes.

Inferencia (Inference)

El proceso de ejecutar un modelo de IA entrenado para generar resultados. Cuando creas un video con una herramienta de IA, el proceso de generación se llama inferencia.

Inpainting

Rellenar o modificar partes específicas de un cuadro de video usando IA.

Avatar instantáneo

Colección de avatares preconfigurados que puedes usar sin entrenamiento adicional.

J

Corte en J

Recurso de edición donde el audio de la siguiente escena empieza antes que la imagen para suavizar la transición.

Reducción de jitter

Filtros que estabilizan micro movimientos o ruido generados por la IA en cada cuadro.

K

Fotograma clave (Keyframe)

Marcador que indica cambios en animación, posición de cámara o efectos dentro del editor.

Fecha de corte del conocimiento

Último día con el que se entrenó un modelo generativo; útil para evaluar datos actualizados.

L

Latencia

Tiempo que pasa desde que lanzas la generación hasta que recibes el video final.

Sincronización labial

Ajuste fino para que la boca del avatar coincida exactamente con el audio.

LLM (Large Language Model)

Modelo lingüístico que ayuda a redactar guiones e instrucciones para los videos.

LoRA (Low-Rank Adaptation)

Una técnica de ajuste fino ligera que entrena pequeños módulos adaptadores en lugar del modelo de IA completo. Popular para añadir estilos personalizados, personajes o conceptos a generadores de video.

M

Captura de movimiento

Registro de movimientos reales para transferirlos al avatar y lograr mayor naturalidad.

Soporte multilenguaje

Capacidad de generar videos con pronunciación nativa en múltiples idiomas.

Modelo multimodal unificado

Un solo motor que maneja texto a video, imagen a video, edición y transferencia de estilo, combinando entradas de texto, imagen, video y sujeto en lugar de alternar entre modelos especializados. Kling O1 (30 de diciembre de 2025) fue el primero, con salida de hasta 2K a 30fps en clips de 3 a 10 segundos.

MP4

Formato de video más compatible con redes sociales, LMS y plataformas publicitarias.

Multimodal

Modelos de IA que pueden entender y generar múltiples tipos de contenido—texto, imágenes, audio y video—dentro de un solo sistema. Ejemplos incluyen GPT-4V y Gemini. Los generadores de video que combinan texto, imágenes, video y audio en un solo motor se agrupan bajo Modelo multimodal unificado.

N

Negative Prompt (Prompt negativo)

Instrucciones que le dicen a la IA qué NO incluir en el contenido generado. Se usa para evitar elementos no deseados como imágenes borrosas, extremidades extra o estilos específicos.

Procesamiento de lenguaje natural (PLN)

Tecnología que permite a la IA entender y generar texto para guiones o prompts.

Red neuronal

Arquitectura matemática que impulsa la clonación de voz y la animación de avatares.

O

Overdub

Reemplazar un diálogo ya grabado con voz generada manteniendo el ritmo original.

Outpainting

Expandir una escena más allá del encuadre original, completando el entorno con IA.

P

Fotorrealismo

Nivel de detalle que hace que un render luzca como una fotografía o video real.

Tono (Pitch)

Altura de la voz; se ajusta para hacerla más grave, aguda o juvenil.

Pesos abiertos

Los parámetros entrenados de un modelo se publican para descarga, normalmente en Hugging Face, bajo una licencia que puede restringir el uso comercial; no es lo mismo que código abierto, que también publica el código de entrenamiento y los datos. LTX-2.5 (agosto de 2026) tiene pesos abiertos y es gratis para organizaciones con menos de 10 millones de dólares de facturación anual; Hailuo 3.0 también publicó pesos abiertos.

Preajuste (Preset)

Configuración guardada que acelera la producción (colores, cámara, música, etc.).

Q

Umbral de calidad

Métrica mínima (resolución, bitrate o confianza de IA) que debes alcanzar antes de finalizar el render.

Cuantización

Técnica para comprimir modelos y correrlos en hardware ligero sacrificando un poco de detalle.

R

Renderizado

Proceso en el que la plataforma genera el archivo final a partir del guion y la configuración.

Resolución

Cantidad de pixeles del video (1080p, 4K, etc.). Más resolución = mayor nitidez y peso.

Resolución 4K nativa

Renderizar fotogramas de 3840×2160 directamente en lugar de generar a menor resolución y luego escalar. Los modelos Video 3.0 de Kling lo añadieron en mayo de 2026, con hasta 60fps y clips de 15 segundos.

S

Guion

Texto que el avatar narrará en cámara.

Separación de pistas (Stem Separation)

Tecnología de IA que divide una pista de audio mezclada en componentes individuales (stems) como voces, batería, bajo y otros instrumentos. Se usa para remixes, karaoke y creación de contenido.

Sora

Modelo de texto a video de OpenAI. La app Sora 2 se lanzó en septiembre de 2025 con audio generado y una función de “cameo”; OpenAI discontinuó tanto la app como la API el 25 de marzo de 2026. Más en por qué cerró Sora.

Storyboard (generación multiplano)

Definir varios planos conectados en una sola generación, cada uno con su propia cámara, duración y perspectiva, de modo que el clip corte entre ellos de forma coherente. Kling 3.0 permite hasta seis planos dentro de un clip de 15 segundos; LTX-2.5 incluye flujos de trabajo multiplano para ComfyUI.

Medios sintéticos

Contenido (video, audio, imagen) creado o alterado por inteligencia artificial.

Synthesia

Proveedor destacado de video con avatares para empresas y equipos de formación.

SynthID

Marca de agua invisible de Google incrustada en los píxeles o el audio de los archivos generados, detectable tras ediciones, compresión y recortes. Permanece incluso cuando la marca de agua visible de Gemini está desactivada (un interruptor añadido el 14 de agosto de 2026). Más en el interruptor de marca de agua de Gemini.

T

Consistencia temporal (Temporal Consistency)

Qué tan suave y coherentemente un video generado por IA mantiene los elementos visuales entre frames. Una pobre consistencia temporal causa parpadeo, objetos que se transforman o personajes que cambian de apariencia a mitad del video.

Texto a música (Text-to-Music)

Sistemas de IA que generan composiciones musicales completas a partir de descripciones de texto. Plataformas como Suno y Udio pueden crear canciones con voces, instrumentos y producción desde prompts simples.

Texto a voz (TTS)

Conversión de texto en audio con voces neuronales naturales.

Texto a video

Generar video a partir de una descripción de texto o guion. La mayoría de los modelos de 2026, incluidos Kling 3.0 y Hailuo 3.0, también generan la banda sonora en la misma pasada; ver Audio nativo.

Plantilla

Diseño prearmado de escenas, fondos y llamados a la acción que acelera la producción.

Miniatura

Imagen previa que se muestra antes de reproducir el video.

U

Umbral de indistinguibilidad

El umbral de indistinguibilidad es el punto en el que las personas ya no pueden distinguir con fiabilidad un contenido generado por IA de una grabación real. La clonación de voz lo cruzó en 2025: unos pocos segundos de audio ahora producen un clon con entonación natural, énfasis, pausas y respiración, un hallazgo destacado por Siwei Lyu, de la Universidad de Buffalo. Más en la revisión de deepfakes de 2025.

Upscaling

Usar IA para aumentar la resolución de un video terminado, por ejemplo de 1080p a 4K. Compara con Resolución 4K nativa, donde el modelo renderiza directamente los fotogramas a resolución completa.

V

Video a video (vid2vid)

Transformar material de video existente usando IA para cambiar su estilo, apariencia o contenido mientras se preserva el movimiento y estructura originales.

Clonación de voz

Crear una copia sintética de la voz de alguien para narrar cualquier guion.

Modulación de voz

Ajustar velocidad, tono y emoción para adaptar la locución al contexto.

VTT / SRT

Formatos de subtítulos utilizados para añadir captioning accesible.

W

Marca de agua

Un logo o texto superpuesto visible, común en planes gratuitos y pruebas. Distinto de marcas invisibles como SynthID y metadatos de procedencia como C2PA, que permanecen incrustados incluso cuando la marca visible está desactivada.

Flujo de trabajo

Secuencia completa desde la idea hasta la publicación del video.

X

XR (Realidad extendida)

Paraguas que incluye realidad virtual, aumentada y mixta; muchos avatares se usan en experiencias XR.

Subtítulos XML

Archivos en formato TTML/DFXP usados para TV o plataformas que requieren metadatos adicionales.

Y

Espacio de color YUV

Modelo de color usado por la mayoría de servicios de streaming; conviene conocerlo para exportar correctamente.

YouTube Shorts

Formato vertical de menos de 60 segundos que muchas herramientas de IA ya optimizan por defecto.

Z

Generación zero-shot

Crear un video convincente sin ejemplos previos del sujeto, solo con texto.

Importación de grabaciones de Zoom

Subir una reunión a la plataforma para resumirla, traducirla o convertirla en clips editados.

Mantén este glosario a la mano cada vez que coordines proyectos con avatares o audio sintético; alinear el lenguaje acelera cualquier reunión técnica.

¿Te resultó útil este artículo?

0:00