Glosario esencial de video generado con IA
Ideal para: marketers de producto, equipos operativos, agencias e influencers que necesitan un glosario rápido mientras guionizan contenido con IA.
Novedades de 2026: este glosario se amplió en septiembre de 2026 con quince términos sobre cómo funcionan los modelos y cómo se regula el contenido de IA: etiqueta de contenido de IA, DAW con IA, C2PA, créditos, umbral de indistinguibilidad, control de movimiento, audio nativo, resolución 4K nativa, pesos abiertos, generación en tiempo real, entradas de referencia, Sora, storyboard, SynthID y modelo multimodal unificado.
A
Audio Inpainting
Uso de IA para rellenar huecos, eliminar sonidos no deseados o reparar secciones dañadas de grabaciones de audio manteniendo un flujo natural.
Audio nativo
El modelo genera diálogos, efectos de sonido y música en la misma pasada que los píxeles, en lugar de añadir una pista de voz después. Kling 3.0 (febrero de 2026) lo hace en cinco idiomas; Hailuo 3.0 devuelve audio estéreo en clips de 2K y 24fps.
Avatar de IA
Presentador digital generado por IA que interpreta tu guion y puede reemplazar a actores humanos.
Animación labial (Lip-sync)
Tecnología que alinea los movimientos de la boca con el audio sintetizado para que el avatar se vea natural.
Aspect ratio
Relación entre ancho y alto del video (16:9 horizontal, 9:16 vertical, etc.).
B
Borrado de fondo
Herramienta que elimina automáticamente el fondo real para colocar escenarios generados.
Generación por lotes
Crear varios videos al mismo tiempo a partir de plantillas o scripts diferentes.
Brand kit
Paquete de logos, tipografías y colores que mantiene la identidad visual en cada video.
C
C2PA (Content Credentials)
Estándar abierto que adjunta metadatos de procedencia que registran que un archivo fue generado por IA y con qué herramienta. Invisible para un espectador casual. Google lo incluye en las salidas de Gemini incluso cuando la marca de agua visible está desactivada; Synthesia lo incluye por defecto. Más en el interruptor de marca de agua de Gemini.
CFG Scale (Classifier-Free Guidance)
Parámetro que controla cuán fielmente la IA sigue tu prompt. Valores altos producen resultados más fieles; valores bajos permiten más libertad creativa.
Checkpoint
Estado guardado de los pesos entrenados de un modelo de IA. Diferentes checkpoints pueden producir distintos estilos visuales o capacidades.
Clonación de voz
Proceso que replica tu timbre y ritmo tras grabar un muestreo guiado.
Control de movimiento
Dirigir a un personaje generado con un video de referencia de una actuación real para que el resultado copie el movimiento. Kling VIDEO 2.6 (diciembre de 2025) acepta referencias de 3 a 30 segundos y sigue el cuerpo completo, las manos y la expresión facial.
ControlNet
Técnica que proporciona control preciso sobre la generación de imágenes y video con IA usando imágenes de referencia para poses, bordes, mapas de profundidad u otras guías visuales.
Créditos
La unidad de facturación que usan la mayoría de generadores; cada clip cuesta una cantidad de créditos que sube con la resolución y la duración, así que un plan mensual es en realidad un presupuesto mensual de segundos. Por ejemplo, Runway cobra Hailuo 3.0 a 15 créditos por segundo de video en 2K.
Avatar personalizado
Modelo entrenado con tu imagen o la de un vocero para tener una versión digital propia.
D
DAW con IA
Estación de trabajo de audio digital en el navegador con generación integrada, de modo que prompts, stems, MIDI y mezcla conviven en un solo proyecto. Suno Studio 2.0 (13 de agosto de 2026) añadió grabación y edición de MIDI, un colaborador de chat con IA y plugins personalizados, y permite que los clips MIDI funcionen como prompts.
Deepfake
Video manipulado que suplanta la identidad de una persona real; puede ser ético o malicioso según el uso. Desde el 2 de agosto de 2026, las normas de la UE exigen que los deepfakes lleven una etiqueta visible de IA (ver etiqueta de contenido de IA).
Modelo de difusión (Diffusion Model)
La arquitectura de IA que impulsa generadores de video modernos como Kling, Veo y Runway (Sora se discontinuó en marzo de 2026). Funciona aprendiendo a eliminar ruido de estática aleatoria hasta que emerge una imagen o video coherente.
Humano digital
Otro nombre para un avatar hiperrealista que luce y actúa como una persona.
Doblaje
Reemplazar el audio original por otro idioma manteniendo sincronía de labios y gestos.
E
Casos extremos
Situaciones poco comunes (acentos raros, nombres técnicos) donde la IA puede fallar.
Formato de exportación
Tipo de archivo final (MP4, MOV, WebM) que eliges al descargar el video.
Entradas de referencia
Imágenes, clips o audio que se aportan junto con el prompt para que el modelo mantenga coherente a un personaje, objeto o escenario. Google Veo 3.1 lo llama “Ingredients to Video”; Hailuo 3.0 acepta hasta 12 archivos de referencia por generación (como máximo 9 imágenes, 3 clips de video y 3 clips de audio).
Etiqueta de contenido de IA
Aviso visible de que un video, imagen o archivo de audio fue generado por IA. El Artículo 50 de la AI Act europea y la SB 942 de California se aplican desde el 2 de agosto de 2026; la UE además exige marcado legible por máquina (con plazo el 2 de diciembre de 2026 para los sistemas ya en el mercado) y multas de hasta 15 millones de euros o el 3% de la facturación. Más en la cobertura de la AI Act de la UE.
F
Fine-tuning (Ajuste fino)
El proceso de tomar un modelo de IA preentrenado y entrenarlo más con datos específicos para especializarlo en una tarea, estilo o tema particular.
Reemplazo de rostro
Tecnología que cambia la cara de un actor por la de otra persona dentro del video.
Fotogramas por segundo (FPS)
Cantidad de imágenes mostradas cada segundo; 24‑30 fps es el estándar.
Frontend / Backend
Frontend es lo que ve el usuario; backend es el motor de IA que procesa voz, video y guion.
G
Generación en tiempo real
Producir un clip en menos tiempo real del que dura el propio clip. LTX-2.5 generó un clip de 720p y 10 segundos en 6.8 segundos sobre hardware NVIDIA GB200.
IA generativa
Modelos capaces de crear contenido nuevo (imágenes, voz, video) en lugar de solo analizar datos.
Control de gestos
Capacidad de definir movimientos de manos o cuerpo para que el avatar comunique mejor.
Pantalla verde virtual
Fondo liso que permite exportar al avatar con transparencia para componer sobre otra escena.
H
Alucinación (Hallucination)
Cuando la IA genera contenido falso, sin sentido o factualmente incorrecto. En video, puede aparecer como manos distorsionadas, física imposible o rostros que se deforman de manera antinatural.
Hiperrealista
Contenido generado que resulta casi indistinguible de una grabación real. Cuando los espectadores ya no pueden notarlo en absoluto, el resultado ha cruzado el umbral de indistinguibilidad.
HeyGen
Plataforma popular de video con avatares y clonación de voz lista para empresas.
I
Imagen a video (img2vid)
Generación de contenido de video a partir de una sola imagen estática. La IA anima la imagen estática, añadiendo movimiento, movimientos de cámara o animación de personajes.
Inferencia (Inference)
El proceso de ejecutar un modelo de IA entrenado para generar resultados. Cuando creas un video con una herramienta de IA, el proceso de generación se llama inferencia.
Inpainting
Rellenar o modificar partes específicas de un cuadro de video usando IA.
Avatar instantáneo
Colección de avatares preconfigurados que puedes usar sin entrenamiento adicional.
J
Corte en J
Recurso de edición donde el audio de la siguiente escena empieza antes que la imagen para suavizar la transición.
Reducción de jitter
Filtros que estabilizan micro movimientos o ruido generados por la IA en cada cuadro.
K
Fotograma clave (Keyframe)
Marcador que indica cambios en animación, posición de cámara o efectos dentro del editor.
Fecha de corte del conocimiento
Último día con el que se entrenó un modelo generativo; útil para evaluar datos actualizados.
L
Latencia
Tiempo que pasa desde que lanzas la generación hasta que recibes el video final.
Sincronización labial
Ajuste fino para que la boca del avatar coincida exactamente con el audio.
LLM (Large Language Model)
Modelo lingüístico que ayuda a redactar guiones e instrucciones para los videos.
LoRA (Low-Rank Adaptation)
Una técnica de ajuste fino ligera que entrena pequeños módulos adaptadores en lugar del modelo de IA completo. Popular para añadir estilos personalizados, personajes o conceptos a generadores de video.
M
Captura de movimiento
Registro de movimientos reales para transferirlos al avatar y lograr mayor naturalidad.
Soporte multilenguaje
Capacidad de generar videos con pronunciación nativa en múltiples idiomas.
Modelo multimodal unificado
Un solo motor que maneja texto a video, imagen a video, edición y transferencia de estilo, combinando entradas de texto, imagen, video y sujeto en lugar de alternar entre modelos especializados. Kling O1 (30 de diciembre de 2025) fue el primero, con salida de hasta 2K a 30fps en clips de 3 a 10 segundos.
MP4
Formato de video más compatible con redes sociales, LMS y plataformas publicitarias.
Multimodal
Modelos de IA que pueden entender y generar múltiples tipos de contenido—texto, imágenes, audio y video—dentro de un solo sistema. Ejemplos incluyen GPT-4V y Gemini. Los generadores de video que combinan texto, imágenes, video y audio en un solo motor se agrupan bajo Modelo multimodal unificado.
N
Negative Prompt (Prompt negativo)
Instrucciones que le dicen a la IA qué NO incluir en el contenido generado. Se usa para evitar elementos no deseados como imágenes borrosas, extremidades extra o estilos específicos.
Procesamiento de lenguaje natural (PLN)
Tecnología que permite a la IA entender y generar texto para guiones o prompts.
Red neuronal
Arquitectura matemática que impulsa la clonación de voz y la animación de avatares.
O
Overdub
Reemplazar un diálogo ya grabado con voz generada manteniendo el ritmo original.
Outpainting
Expandir una escena más allá del encuadre original, completando el entorno con IA.
P
Fotorrealismo
Nivel de detalle que hace que un render luzca como una fotografía o video real.
Tono (Pitch)
Altura de la voz; se ajusta para hacerla más grave, aguda o juvenil.
Pesos abiertos
Los parámetros entrenados de un modelo se publican para descarga, normalmente en Hugging Face, bajo una licencia que puede restringir el uso comercial; no es lo mismo que código abierto, que también publica el código de entrenamiento y los datos. LTX-2.5 (agosto de 2026) tiene pesos abiertos y es gratis para organizaciones con menos de 10 millones de dólares de facturación anual; Hailuo 3.0 también publicó pesos abiertos.
Preajuste (Preset)
Configuración guardada que acelera la producción (colores, cámara, música, etc.).
Q
Umbral de calidad
Métrica mínima (resolución, bitrate o confianza de IA) que debes alcanzar antes de finalizar el render.
Cuantización
Técnica para comprimir modelos y correrlos en hardware ligero sacrificando un poco de detalle.
R
Renderizado
Proceso en el que la plataforma genera el archivo final a partir del guion y la configuración.
Resolución
Cantidad de pixeles del video (1080p, 4K, etc.). Más resolución = mayor nitidez y peso.
Resolución 4K nativa
Renderizar fotogramas de 3840×2160 directamente en lugar de generar a menor resolución y luego escalar. Los modelos Video 3.0 de Kling lo añadieron en mayo de 2026, con hasta 60fps y clips de 15 segundos.
S
Guion
Texto que el avatar narrará en cámara.
Separación de pistas (Stem Separation)
Tecnología de IA que divide una pista de audio mezclada en componentes individuales (stems) como voces, batería, bajo y otros instrumentos. Se usa para remixes, karaoke y creación de contenido.
Sora
Modelo de texto a video de OpenAI. La app Sora 2 se lanzó en septiembre de 2025 con audio generado y una función de “cameo”; OpenAI discontinuó tanto la app como la API el 25 de marzo de 2026. Más en por qué cerró Sora.
Storyboard (generación multiplano)
Definir varios planos conectados en una sola generación, cada uno con su propia cámara, duración y perspectiva, de modo que el clip corte entre ellos de forma coherente. Kling 3.0 permite hasta seis planos dentro de un clip de 15 segundos; LTX-2.5 incluye flujos de trabajo multiplano para ComfyUI.
Medios sintéticos
Contenido (video, audio, imagen) creado o alterado por inteligencia artificial.
Synthesia
Proveedor destacado de video con avatares para empresas y equipos de formación.
SynthID
Marca de agua invisible de Google incrustada en los píxeles o el audio de los archivos generados, detectable tras ediciones, compresión y recortes. Permanece incluso cuando la marca de agua visible de Gemini está desactivada (un interruptor añadido el 14 de agosto de 2026). Más en el interruptor de marca de agua de Gemini.
T
Consistencia temporal (Temporal Consistency)
Qué tan suave y coherentemente un video generado por IA mantiene los elementos visuales entre frames. Una pobre consistencia temporal causa parpadeo, objetos que se transforman o personajes que cambian de apariencia a mitad del video.
Texto a música (Text-to-Music)
Sistemas de IA que generan composiciones musicales completas a partir de descripciones de texto. Plataformas como Suno y Udio pueden crear canciones con voces, instrumentos y producción desde prompts simples.
Texto a voz (TTS)
Conversión de texto en audio con voces neuronales naturales.
Texto a video
Generar video a partir de una descripción de texto o guion. La mayoría de los modelos de 2026, incluidos Kling 3.0 y Hailuo 3.0, también generan la banda sonora en la misma pasada; ver Audio nativo.
Plantilla
Diseño prearmado de escenas, fondos y llamados a la acción que acelera la producción.
Miniatura
Imagen previa que se muestra antes de reproducir el video.
U
Umbral de indistinguibilidad
El umbral de indistinguibilidad es el punto en el que las personas ya no pueden distinguir con fiabilidad un contenido generado por IA de una grabación real. La clonación de voz lo cruzó en 2025: unos pocos segundos de audio ahora producen un clon con entonación natural, énfasis, pausas y respiración, un hallazgo destacado por Siwei Lyu, de la Universidad de Buffalo. Más en la revisión de deepfakes de 2025.
Upscaling
Usar IA para aumentar la resolución de un video terminado, por ejemplo de 1080p a 4K. Compara con Resolución 4K nativa, donde el modelo renderiza directamente los fotogramas a resolución completa.
V
Video a video (vid2vid)
Transformar material de video existente usando IA para cambiar su estilo, apariencia o contenido mientras se preserva el movimiento y estructura originales.
Clonación de voz
Crear una copia sintética de la voz de alguien para narrar cualquier guion.
Modulación de voz
Ajustar velocidad, tono y emoción para adaptar la locución al contexto.
VTT / SRT
Formatos de subtítulos utilizados para añadir captioning accesible.
W
Marca de agua
Un logo o texto superpuesto visible, común en planes gratuitos y pruebas. Distinto de marcas invisibles como SynthID y metadatos de procedencia como C2PA, que permanecen incrustados incluso cuando la marca visible está desactivada.
Flujo de trabajo
Secuencia completa desde la idea hasta la publicación del video.
X
XR (Realidad extendida)
Paraguas que incluye realidad virtual, aumentada y mixta; muchos avatares se usan en experiencias XR.
Subtítulos XML
Archivos en formato TTML/DFXP usados para TV o plataformas que requieren metadatos adicionales.
Y
Espacio de color YUV
Modelo de color usado por la mayoría de servicios de streaming; conviene conocerlo para exportar correctamente.
YouTube Shorts
Formato vertical de menos de 60 segundos que muchas herramientas de IA ya optimizan por defecto.
Z
Generación zero-shot
Crear un video convincente sin ejemplos previos del sujeto, solo con texto.
Importación de grabaciones de Zoom
Subir una reunión a la plataforma para resumirla, traducirla o convertirla en clips editados.
Mantén este glosario a la mano cada vez que coordines proyectos con avatares o audio sintético; alinear el lenguaje acelera cualquier reunión técnica.