Vai al contenuto

Glossario Video IA: 65+ Termini Spiegati

Darius Z. Di Darius Z. Aggiornato: 12 min di lettura
Visuale glossario video IA

Ottimo per: marketer di prodotto, team operativi, scrittori di agenzie e influencer che hanno bisogno di un riferimento rapido durante la scrittura di contenuti alimentati da IA.

Novità 2026: questo glossario è stato ampliato a settembre 2026 con quindici termini su come funzionano i modelli del 2026 e su come viene regolamentato l’output IA: Etichetta Contenuti IA, DAW IA, C2PA, Crediti, Soglia di Indistinguibilità, Controllo del Movimento, Audio Nativo, Risoluzione 4K nativa, Open Weights, Generazione in Tempo Reale, Input di Riferimento, Sora, Storyboard, SynthID e Modello Multimodale Unificato.

A

Avatar IA

Un personaggio digitale generato dall’intelligenza artificiale che può parlare e muoversi in modo realistico. Utilizzato nei video per sostituire attori umani.

Audio Inpainting

Usare l’IA per riempire vuoti, rimuovere suoni indesiderati o riparare sezioni danneggiate di registrazioni audio mantenendo un flusso naturale.

Audio Nativo

Il modello genera dialoghi, effetti sonori e musica nello stesso passaggio dei pixel, invece di aggiungere una traccia vocale in un secondo momento. Kling 3.0 (febbraio 2026) lo fa in cinque lingue; Hailuo 3.0 restituisce audio stereo con clip 2K a 24fps. Vedi Kling 3.0 e Hailuo 3.0.

Sintesi Audio

Il processo di generazione di un parlato simile a quello umano usando l’IA invece di registrare la voce di una persona reale.

Formato d’Aspetto

Il rapporto larghezza-altezza di un video (es. 16:9 per widescreen, 9:16 per verticale/mobile).

B

Rimozione dello Sfondo

Tecnologia IA che rimuove automaticamente lo sfondo dai filmati video, permettendoti di sostituirlo con scene personalizzate.

Generazione in Batch

Creare più video simultaneamente da script o modelli diversi.

Brand Kit

Una raccolta di loghi, colori, font e risorse utilizzate per mantenere un branding coerente tra i video.

C

C2PA (Content Credentials)

Uno standard aperto che allega metadati di provenienza che registrano che un file è stato generato dall’IA e con quale strumento. Invisibile a chi guarda distrattamente. Google lo integra negli output di Gemini anche quando la filigrana visibile è disattivata; Synthesia lo integra di default. Vedi interruttore filigrana Gemini.

Scala CFG (Classifier-Free Guidance)

Un parametro che controlla quanto da vicino l’IA segue il tuo prompt. Valori più alti creano output più fedeli alla tua descrizione; valori più bassi permettono più libertà creativa.

Checkpoint

Uno stato salvato dei pesi addestrati di un modello IA. Checkpoint diversi possono produrre stili visivi o capacità diverse.

Clonazione Vocale

Creare una copia sintetica della voce di una persona che può pronunciare qualsiasi testo mantenendo le caratteristiche della voce originale.

Controllo del Movimento

Guidare un personaggio generato con un video di riferimento di una performance reale, in modo che l’output ne copi il movimento. Kling VIDEO 2.6 (dicembre 2025) accetta riferimenti da 3 a 30 secondi e traccia corpo intero, mani ed espressioni facciali. Vedi controllo movimento di Kling.

ControlNet

Una tecnica che dà controllo preciso sulla generazione di immagini e video IA usando immagini di riferimento per pose, bordi, mappe di profondità o altre guide visive.

Avatar Personalizzato

Un avatar IA personalizzato creato da filmati di una persona specifica, utilizzato per rappresentare la loro somiglianza digitale.

Crediti

L’unità di fatturazione usata dalla maggior parte dei generatori: ogni clip costa un certo numero di crediti che cresce con risoluzione e durata, quindi un piano mensile è in realtà un budget mensile di secondi. Esempio: Runway misura Hailuo 3.0 a 15 crediti per secondo di video 2K. Vedi Hailuo 3.0 su Runway.

D

DAW IA

Una workstation audio digitale basata su browser con generazione integrata, così prompt, stem, MIDI e mixaggio convivono in un unico progetto. Suno Studio 2.0 (13 agosto 2026) ha aggiunto registrazione ed editing MIDI, un collaboratore IA in chat e plugin personalizzati, e permette alle clip MIDI di funzionare come prompt. Vedi Suno Studio 2.0.

Deepfake

Tecnologia di manipolazione video che scambia volti o altera contenuti. Controversa quando usata senza consenso (non la stessa cosa degli avatar IA etici). Dal 2 agosto 2026, le norme UE richiedono che i deepfake portino un’etichetta IA visibile (vedi Etichetta Contenuti IA).

Modello di Diffusione

L’architettura IA che alimenta i moderni generatori video come Kling, Veo e Runway (Sora è stata dismessa a marzo 2026). Funziona imparando a rimuovere il rumore da staticità casuale fino a quando emerge un’immagine o video coerente.

Umano Digitale

Un altro termine per avatar IA - una persona generata dal computer che sembra e agisce umana.

Doppiaggio

Sostituire l’audio originale in un video con una lingua diversa sincronizzando i movimenti delle labbra.

E

Casi Limite

Scenari insoliti o rari dove l’IA potrebbe non performare in modo ottimale (es. pronunce non comuni).

Etichetta Contenuti IA

Una dichiarazione visibile che indica che un video, un’immagine o un file audio è stato generato dall’IA. L’AI Act europeo (Articolo 50) e la legge californiana SB 942 si applicano dal 2 agosto 2026, e l’UE richiede anche una marcatura leggibile da macchina (in vigore dal 2 dicembre 2026 per i sistemi già sul mercato) con multe fino a 15 milioni di euro o il 3% del fatturato. Vedi copertura dell’AI Act UE.

Formato di Esportazione

Il tipo di file in cui il tuo video viene salvato (es. MP4, MOV, WebM).

F

Scambio Volto

Tecnologia che sostituisce il volto di una persona con quello di un’altra in un video.

Fine-Tuning

Il processo di prendere un modello IA pre-addestrato e addestrarlo ulteriormente su dati specifici per specializzarlo per un compito, stile o soggetto particolare.

Frame Rate

Quante immagini (frame) vengono mostrate al secondo in un video. Lo standard è 24-30 fps.

Frontend/Backend

Frontend si riferisce a ciò che gli utenti vedono, backend si riferisce all’elaborazione IA che avviene dietro le quinte.

G

IA Generativa

IA che crea nuovi contenuti (immagini, video, audio) piuttosto che solo analizzare contenuti esistenti.

Controllo Gestuale

La capacità di programmare i movimenti delle mani e il linguaggio del corpo di un avatar.

Generazione in Tempo Reale

Produrre una clip in un tempo reale inferiore alla durata della clip stessa. LTX-2.5 ha generato una clip 720p di 10 secondi in 6,8 secondi su hardware NVIDIA GB200. Vedi LTX-2.5.

Green Screen

Una tecnica dove uno sfondo di colore solido (di solito verde) viene sostituito con altre immagini. L’IA può farlo automaticamente ora.

H

Allucinazione

Quando l’IA genera contenuti falsi, privi di senso o fattualmente incorretti. Nei video, questo potrebbe apparire come mani distorte, fisica impossibile o volti che si trasformano in modo innaturale.

Iper-Realistico

Contenuti generati da IA estremamente difficili da distinguere da filmati reali. Quando gli spettatori non riescono più a distinguerli affatto, l’output ha superato la soglia di indistinguibilità.

HeyGen

Una popolare piattaforma di video avatar IA nota per la clonazione vocale e la facilità d’uso.

I

Immagine-a-Video (img2vid)

Generare contenuti video da una singola immagine statica. L’IA anima l’immagine statica, aggiungendo movimento, movimento della telecamera o animazione dei personaggi.

Inferenza

Il processo di esecuzione di un modello IA addestrato per generare output. Quando crei un video con uno strumento IA, il processo di generazione si chiama inferenza.

Inpainting

Riempire o modificare parti di un frame video usando l’IA.

Input di Riferimento

Immagini, clip o audio forniti insieme al prompt affinché il modello mantenga coerenti un personaggio, un oggetto o un’ambientazione. Google Veo 3.1 chiama questa funzione “Ingredients to Video”; Hailuo 3.0 accetta fino a 12 file di riferimento per generazione (al massimo 9 immagini, 3 clip video e 3 clip audio). Vedi Veo 3.1.

Avatar Istantaneo

Avatar IA pre-fatti disponibili immediatamente senza addestramento personalizzato.

J

J-Cut

Una tecnica di montaggio dove l’audio dalla scena successiva inizia a suonare prima che finisca il visivo corrente. Utile per far sentire le scene generate da IA più naturali.

Riduzione Jitter

Filtri di stabilizzazione che rimuovono piccole vibrazioni della telecamera o rumore frame-to-frame nei filmati renderizzati da IA.

K

Keyframe

Un frame che segna un cambiamento nell’animazione, posizione della telecamera o effetto. Molti editor video IA ti permettono di impostare keyframe per pose dell’avatar o movimenti della telecamera.

Knowledge Cutoff

La data più recente su cui un modello di IA generativa è stato addestrato. Importante quando gli strumenti IA citano fatti all’interno dei tuoi script.

L

Latenza

Il ritardo tra l’avvio della generazione video e la ricezione del prodotto finito.

Sincronizzazione Labiale

Corrispondere i movimenti della bocca di un avatar alle parole pronunciate. Critico per video realistici.

LLM (Large Language Model)

Modelli IA come GPT che possono aiutare a scrivere script e generare contenuti video.

LoRA (Low-Rank Adaptation)

Una tecnica di fine-tuning leggera che addestra piccoli moduli adattatori invece dell’intero modello IA. Popolare per aggiungere stili personalizzati, personaggi o concetti ai generatori video.

M

Modello Multimodale Unificato

Un unico motore che gestisce text-to-video, image-to-video, editing e trasferimento di stile, prendendo insieme input testuali, di immagine, video e soggetto invece di passare da un modello specializzato all’altro. Kling O1 (30 dicembre 2025) è stato il primo, con output fino a 2K a 30fps in clip da 3 a 10 secondi. Vedi Kling O1.

Motion Capture

Registrare movimenti umani reali per far muovere gli avatar in modo più naturale.

Supporto Multi-Lingua

La capacità di creare video in molte lingue diverse con pronuncia nativa.

MP4

Il formato di file video più comune, ampiamente compatibile con tutte le piattaforme.

Multimodale

Modelli IA che possono comprendere e generare più tipi di contenuti—testo, immagini, audio e video—all’interno di un singolo sistema. Esempi includono GPT-4V e Gemini. I generatori video che prendono in input testo, immagini, video e audio in un unico motore rientrano nel Modello Multimodale Unificato.

N

Elaborazione del Linguaggio Naturale (NLP)

L’abilità dell’IA di comprendere e generare linguaggio umano - usata per l’analisi degli script e le voci fuori campo.

Prompt Negativo

Istruzioni che dicono all’IA cosa NON includere nel contenuto generato. Usato per evitare elementi indesiderati come immagini sfocate, arti extra o stili specifici.

Rete Neurale

L’architettura IA che alimenta la generazione di avatar e la sintesi vocale.

O

Open Weights

I parametri addestrati di un modello vengono pubblicati per il download, in genere su Hugging Face, con una licenza che può limitare l’uso commerciale; è diverso dall’open source, che rilascia anche il codice e i dati di addestramento. LTX-2.5 (agosto 2026) è open weights e gratuito per le organizzazioni con meno di 10 milioni di dollari di fatturato annuo; anche Hailuo 3.0 ha rilasciato pesi aperti. Vedi LTX-2.5.

Overdub

Sostituire dialoghi esistenti con nuovo parlato generato da IA mantenendo il timing intatto.

Outpainting

Estendere scene video oltre i loro bordi originali usando l’IA per immaginare i pixel extra.

P

Foto-Realistico

Qualità visiva che assomiglia strettamente a fotografia o filmati video reali.

Tono

L’altezza o la bassezza di una voce. Può essere regolato nella generazione vocale IA.

Preset

Impostazioni o modelli pre-configurati che accelerano la creazione video.

Q

Soglia di Qualità

Uno standard minimo (risoluzione, bitrate o punteggio di confidenza IA) che deve essere raggiunto prima che il rendering finisca.

Quantizzazione

Comprimere modelli IA così funzionano più velocemente su GPU consumer, a volte a costo di dettagli fini.

R

Rendering

Il processo di generazione del file video finale dal tuo script e impostazioni.

Risoluzione

Qualità video misurata in pixel (es. 1080p, 4K). Più alta = migliore qualità ma file più grandi.

Risoluzione 4K nativa

Renderizzare direttamente fotogrammi a 3840×2160 invece di generare a una risoluzione inferiore e poi fare upscaling. I modelli Video 3.0 di Kling l’hanno introdotto a maggio 2026, con clip fino a 60fps e 15 secondi. Vedi 4K nativo di Kling.

S

Script

Il testo che il tuo avatar IA pronuncerà nel video.

Separazione degli Stemi

Tecnologia IA che divide una traccia audio mista in componenti individuali (stemi) come voci, batteria, basso e altri strumenti. Usata per remix, karaoke e creazione di contenuti.

Soglia di Indistinguibilità

Il punto in cui le persone non riescono più a distinguere con certezza i contenuti generati dall’IA da una registrazione reale. La clonazione vocale l’ha superata nel 2025: bastano pochi secondi di audio per produrre un clone con intonazione naturale, enfasi, pause e respirazione, un risultato messo in luce da Siwei Lyu dell’University at Buffalo. Vedi rapporto sui deepfake 2025.

Sora

Il modello text-to-video di OpenAI. L’app Sora 2 è stata lanciata a settembre 2025 con audio generato e una funzione “cameo”; OpenAI ha dismesso sia l’app sia l’API il 25 marzo 2026. Vedi perché Sora è stata chiusa.

Storyboard (Generazione Multi-Inquadratura)

Definire più inquadrature collegate in un’unica generazione, ciascuna con la propria angolazione, durata e prospettiva, così la clip taglia da una all’altra in modo coerente. Kling 3.0 consente fino a sei inquadrature in una clip di 15 secondi; LTX-2.5 offre flussi di lavoro multi-inquadratura per ComfyUI. Vedi Kling 3.0.

Media Sintetici

Contenuti (video, audio, immagini) creati o modificati dall’IA.

Synthesia

Una piattaforma leader di video avatar IA focalizzata sulle imprese.

SynthID

La filigrana invisibile di Google incorporata nei pixel o nell’audio dei file generati, rilevabile anche dopo modifiche, compressione e ritaglio. Resta in posizione anche quando la filigrana visibile di Gemini viene disattivata (un interruttore aggiunto il 14 agosto 2026). Vedi interruttore filigrana Gemini.

T

Coerenza Temporale

Quanto fluidamente e coerentemente un video generato da IA mantiene elementi visivi tra i frame. Una scarsa coerenza temporale causa sfarfallio, oggetti che si trasformano o personaggi che cambiano aspetto a metà video.

Testo-a-Musica

Sistemi IA che generano composizioni musicali complete da descrizioni testuali. Piattaforme come Suno e Udio possono creare canzoni con voci, strumenti e produzione da prompt semplici.

Text-to-Speech (TTS)

Convertire testo scritto in audio parlato usando voci IA.

Testo-a-Video

Generare video da una descrizione testuale o da uno script. La maggior parte dei modelli 2026, inclusi Kling 3.0 e Hailuo 3.0, genera anche la colonna sonora nello stesso passaggio; vedi Audio Nativo.

Modello

Layout video pre-progettati che accelerano il processo di creazione.

Anteprima

L’immagine di anteprima mostrata prima che un video venga riprodotto.

U

Upscaling

Usare l’IA per aumentare la risoluzione di un video già finito, ad esempio da 1080p a 4K. Confronta con Risoluzione 4K nativa, dove il modello renderizza direttamente i fotogrammi alla risoluzione finale.

V

Video-a-Video (vid2vid)

Trasformare filmati video esistenti usando l’IA per cambiarne lo stile, l’aspetto o il contenuto preservando il movimento e la struttura originali.

Clonazione Vocale

Creare una versione sintetica della voce di qualcuno che può pronunciare qualsiasi testo.

Modulazione Vocale

Regolare le caratteristiche vocali come tono, velocità ed emozione.

VTT/SRT

Formati di file sottotitoli per aggiungere didascalie ai video.

W

Filigrana

Un logo o testo sovrapposto visibile, comune nei piani gratuiti e nelle prove. Diverso dai marchi invisibili come SynthID e dai metadati di provenienza come C2PA, che restano incorporati anche quando il marchio visibile viene disattivato.

Workflow

La serie di passaggi dallo script al video finito.

X

XR (Realtà Estesa)

Un termine ombrello per AR, VR e realtà mista. Gli avatar IA sono spesso portati in esperienze XR.

Sottotitoli XML

File di testo temporizzati (come TTML) esportati da strumenti di sottotitolazione IA per workflow broadcast.

Y

Spazio Colore YUV

Il modello di colore che la maggior parte delle piattaforme di streaming usa. Conoscerlo aiuta quando si esportano filmati IA per corrispondere agli standard broadcast.

YouTube Shorts

Video verticali, sotto i 60 secondi. Molti generatori video IA includono preset per Shorts.

Z

Generazione Zero-Shot

Produrre un video o voce convincente senza fornire filmati o audio di esempio del soggetto target.

Import Registrazione Zoom

Caricare una riunione Zoom in un editor IA così può tagliare, tradurre o trasformarla in clip scriptate.

Conclusione

Questo glossario copre i termini essenziali che incontrerai quando lavori con strumenti di generazione video IA. Man mano che la tecnologia evolve, emergeranno nuovi termini - manterrò questa guida aggiornata!

Aggiungi questa pagina ai preferiti per riferimento rapido durante la creazione dei tuoi video IA.


Manca un termine? Contattami per suggerire aggiunte!

Questo articolo ti è stato utile?

0:00