Zum Inhalt springen

KI-Video-Glossar: Begriffe erklärt

Darius Z. Von Darius Z. Aktualisiert: 12 Min. Lesezeit
KI-Video-Glossar Bild

Ideal für: Produktmarketer, Operations-Teams, Agentur-Autoren und Influencer, die eine schnelle Referenz beim Erstellen von KI-gestütztem Content benötigen.

Neu 2026: Dieses Glossar wurde im September 2026 um fünfzehn Begriffe erweitert, die zeigen, wie die Modelle des Jahres 2026 funktionieren und wie KI-Ausgaben reguliert werden: KI-Kennzeichnung, KI-DAW, C2PA, Credits, Ununterscheidbarkeitsschwelle, Bewegungssteuerung, native Audiogenerierung, natives 4K, offene Modellgewichte, Echtzeitgenerierung, Referenzeingaben, Sora, Storyboard, SynthID und einheitliches multimodales Modell.

A

AI Avatar (KI-Avatar)

Ein von künstlicher Intelligenz generierter digitaler Charakter, der realistisch sprechen und sich bewegen kann. Wird in Videos verwendet, um menschliche Darsteller zu ersetzen.

AI Content Label (KI-Kennzeichnungspflicht)

Eine sichtbare Kennzeichnung, dass ein Video, Bild oder eine Audiodatei KI-generiert wurde. Die Kennzeichnungspflicht nach Artikel 50 des EU-KI-Gesetzes gilt ab dem 2. August 2026, dem Tag, an dem auch Kaliforniens SB 942 in Kraft trat. Die EU verlangt zusätzlich eine maschinenlesbare Markierung (für bereits am Markt befindliche Systeme bis zum 2. Dezember 2026), bei Bußgeldern bis zu 15 Millionen Euro oder 3 % des Umsatzes. Siehe Bericht zum EU-KI-Gesetz.

AI DAW (KI-DAW)

Eine browserbasierte Digital Audio Workstation mit eingebauter KI-Generierung, sodass Prompts, Stems, MIDI und Mixing in einem Projekt zusammenlaufen. Suno Studio 2.0 (13. August 2026) brachte MIDI-Aufnahme und -Bearbeitung, einen KI-Chat-Mitarbeiter und eigene Plugins, wobei MIDI-Clips selbst als Prompts dienen können. Siehe Suno Studio 2.0.

Audio Inpainting

Verwendung von KI zum Füllen von Lücken, Entfernen unerwünschter Geräusche oder Reparieren beschädigter Abschnitte in Audioaufnahmen unter Beibehaltung eines natürlichen Flusses.

Audio Synthesis (Audiosynthese)

Der Prozess der Erzeugung menschenähnlicher Sprache mit KI anstelle der Aufnahme einer echten menschlichen Stimme.

Aspect Ratio (Seitenverhältnis)

Das Breite-zu-Höhe-Verhältnis eines Videos (z.B. 16:9 für Breitbild, 9:16 für vertikal/mobil).

B

Background Removal (Hintergrundentfernung)

KI-Technologie, die automatisch den Hintergrund aus Videomaterial entfernt, sodass Sie ihn durch benutzerdefinierte Szenen ersetzen können.

Batch Generation (Stapelgenerierung)

Das gleichzeitige Erstellen mehrerer Videos aus verschiedenen Skripten oder Vorlagen.

Brand Kit (Marken-Kit)

Eine Sammlung von Logos, Farben, Schriften und Assets zur Aufrechterhaltung eines konsistenten Brandings über Videos hinweg.

C

C2PA (Content Credentials)

Ein offener Standard, der Herkunftsmetadaten anhängt und festhält, dass eine Datei KI-generiert wurde und mit welchem Tool. Für den Betrachter unsichtbar. Google bettet diese Daten in Gemini-Ausgaben ein, selbst wenn das sichtbare Wasserzeichen deaktiviert ist; Synthesia tut dies standardmäßig. Siehe Gemini-Wasserzeichen-Schalter.

CFG Scale (Classifier-Free Guidance)

Ein Parameter, der steuert, wie genau die KI Ihrem Prompt folgt. Höhere Werte erzeugen Ausgaben, die Ihrer Beschreibung treuer sind; niedrigere Werte ermöglichen mehr kreative Freiheit.

Checkpoint

Ein gespeicherter Zustand der trainierten Gewichte eines KI-Modells. Verschiedene Checkpoints können unterschiedliche visuelle Stile oder Fähigkeiten produzieren.

Clone Voice (Stimmenklon)

Das Erstellen einer synthetischen Kopie der Stimme einer Person, die jeden Text sprechen kann, während die Eigenschaften der Originalstimme erhalten bleiben.

ControlNet

Eine Technik, die präzise Kontrolle über KI-Bild- und Videogenerierung bietet, indem Referenzbilder für Posen, Kanten, Tiefenkarten oder andere visuelle Anleitungen verwendet werden.

Credits (Abrechnungseinheiten)

Die Abrechnungseinheit, die die meisten Generatoren verwenden; jeder Clip kostet eine Anzahl an Credits, die mit Auflösung und Länge steigt, sodass ein Monatsplan im Grunde ein monatliches Sekundenbudget ist. Beispiel: Runway berechnet Hailuo 3.0 mit 15 Credits pro Sekunde 2K-Video. Siehe Hailuo 3.0 bei Runway.

Custom Avatar (Benutzerdefinierter Avatar)

Ein personalisierter KI-Avatar, der aus Videomaterial einer bestimmten Person erstellt wurde, um deren digitales Abbild darzustellen.

D

Deepfake

Videomanipulationstechnologie, die Gesichter austauscht oder Inhalte verändert. Kontrovers bei Verwendung ohne Zustimmung (nicht dasselbe wie ethische KI-Avatare). Seit dem 2. August 2026 müssen Deepfakes in der EU laut Vorschrift ein sichtbares KI-Label tragen (siehe KI-Kennzeichnung).

Diffusion Model (Diffusionsmodell)

Die KI-Architektur, die moderne Videogeneratoren wie Kling, Veo und Runway antreibt (Sora wurde im März 2026 eingestellt). Funktioniert, indem sie lernt, Rauschen aus zufälligem Rauschen zu entfernen, bis ein kohärentes Bild oder Video entsteht.

Digital Human (Digitaler Mensch)

Ein anderer Begriff für KI-Avatar – eine computergenerierte Person, die menschlich aussieht und handelt.

Dubbing (Synchronisation)

Das Ersetzen des Originaltons in einem Video durch eine andere Sprache bei gleichzeitiger Synchronisierung der Lippenbewegungen.

E

Edge Cases (Randfälle)

Ungewöhnliche oder seltene Szenarien, in denen KI möglicherweise nicht optimal funktioniert (z.B. ungewöhnliche Aussprachen).

Export Format (Exportformat)

Der Dateityp, in dem Ihr Video gespeichert wird (z.B. MP4, MOV, WebM).

F

Face Swap (Gesichtstausch)

Technologie, die das Gesicht einer Person in einem Video durch das einer anderen ersetzt.

Fine-tuning (Feinabstimmung)

Der Prozess, ein vortrainiertes KI-Modell zu nehmen und es mit spezifischen Daten weiter zu trainieren, um es für eine bestimmte Aufgabe, einen Stil oder ein Thema zu spezialisieren.

Frame Rate (Bildrate)

Wie viele Bilder (Frames) pro Sekunde in einem Video gezeigt werden. Standard ist 24-30 fps.

Frontend/Backend

Frontend bezeichnet, was Benutzer sehen, Backend bezeichnet die KI-Verarbeitung, die im Hintergrund stattfindet.

G

Generative AI (Generative KI)

KI, die neue Inhalte erstellt (Bilder, Videos, Audio), anstatt nur bestehende Inhalte zu analysieren.

Gesture Control (Gestensteuerung)

Die Möglichkeit, Handbewegungen und Körpersprache eines Avatars zu programmieren.

Green Screen (Greenscreen)

Eine Technik, bei der ein einfarbiger Hintergrund (meist grün) durch andere Bilder ersetzt wird. KI kann dies jetzt automatisch.

H

Hallucination (Halluzination)

Wenn KI-Modelle falschen, unsinnigen oder faktisch inkorrekten Inhalt generieren. Bei Videos kann dies als verzerrte Hände, unmögliche Physik oder Gesichter erscheinen, die sich unnatürlich verformen.

Hyper-Realistic (Hyperrealistisch)

KI-generierte Inhalte, die extrem schwer von echtem Videomaterial zu unterscheiden sind. Wenn Betrachter überhaupt keinen Unterschied mehr erkennen, hat die Ausgabe die Ununterscheidbarkeitsschwelle überschritten.

HeyGen

Eine beliebte KI-Avatar-Video-Plattform, bekannt für Voice Cloning und Benutzerfreundlichkeit.

I

Image-to-Video (img2vid)

Generierung von Videoinhalten aus einem einzelnen Standbild. Die KI animiert das statische Bild und fügt Bewegung, Kamerabewegung oder Charakteranimation hinzu.

Indistinguishability Threshold (Ununterscheidbarkeitsschwelle)

Der Punkt, an dem Menschen KI-generierte Medien nicht mehr zuverlässig von einer echten Aufnahme unterscheiden können. Voice Cloning hat diese Schwelle 2025 überschritten: Wenige Sekunden Audio genügen inzwischen für einen Klon mit natürlicher Intonation, Betonung, Pausen und Atmung, wie Siwei Lyu von der University at Buffalo aufzeigte. Siehe Deepfakes-Jahresrückblick 2025.

Inference (Inferenz)

Der Prozess des Ausführens eines trainierten KI-Modells zur Generierung von Ausgaben. Wenn Sie ein Video mit einem KI-Tool erstellen, wird der Generierungsprozess als Inferenz bezeichnet.

Inpainting

Das Ausfüllen oder Modifizieren von Teilen eines Videobilds mit KI.

Instant Avatar (Sofort-Avatar)

Vorgefertigte KI-Avatare, die sofort ohne individuelles Training verfügbar sind.

J

J-Cut

Eine Schnitttechnik, bei der der Ton der nächsten Szene beginnt, bevor das aktuelle Bild endet. Hilfreich, um KI-generierte Szenen natürlicher wirken zu lassen.

Jitter Reduction (Rauschunterdrückung)

Stabilisierungsfilter, die kleine Kamerawackler oder Frame-zu-Frame-Rauschen in KI-gerendertem Material entfernen.

K

Keyframe (Schlüsselbild)

Ein Bild, das eine Änderung in Animation, Kameraposition oder Effekt markiert. Viele KI-Video-Editoren ermöglichen Keyframing von Avatar-Posen oder Kamerabewegungen.

Knowledge Cutoff (Wissensstand)

Das neueste Datum, bis zu dem ein generatives KI-Modell trainiert wurde. Wichtig, wenn KI-Tools Fakten in Ihren Skripten zitieren.

L

Latency (Latenz)

Die Verzögerung zwischen dem Start der Videogenerierung und dem Erhalt des fertigen Produkts.

Lip-Sync (Lippensynchronisation)

Das Abstimmen der Mundbewegungen eines Avatars auf die gesprochenen Worte. Entscheidend für realistische Videos.

LLM (Large Language Model)

KI-Modelle wie GPT, die beim Schreiben von Skripten und Generieren von Videoinhalten helfen können.

LoRA (Low-Rank Adaptation)

Eine leichtgewichtige Feinabstimmungstechnik, die kleine Adaptermodule anstelle des gesamten KI-Modells trainiert. Beliebt zum Hinzufügen benutzerdefinierter Stile, Charaktere oder Konzepte zu Videogeneratoren.

M

Motion Capture (Bewegungserfassung)

Das Aufzeichnen echter menschlicher Bewegungen, damit sich Avatare natürlicher bewegen.

Motion Control (Bewegungssteuerung)

Ein generierter Charakter wird über ein Referenzvideo einer echten Performance gesteuert, sodass die Ausgabe die Bewegung übernimmt. Kling VIDEO 2.6 (Dezember 2025) akzeptiert Referenzen von 3 bis 30 Sekunden und erfasst Ganzkörper-, Hand- und Mimikbewegungen. Siehe Kling Motion Control.

Multi-Language Support (Mehrsprachige Unterstützung)

Die Möglichkeit, Videos in vielen verschiedenen Sprachen mit muttersprachlicher Aussprache zu erstellen.

MP4

Das gebräuchlichste Videodateiformat, weitgehend kompatibel mit allen Plattformen.

Multimodal

KI-Modelle, die mehrere Arten von Inhalten verstehen und generieren können—Text, Bilder, Audio und Video—innerhalb eines einzigen Systems. Beispiele sind GPT-4V und Gemini. Videogeneratoren, die Text, Bilder, Video und Audio in einer Engine vereinen, fallen unter Unified Multimodal Model.

N

Native 4K (Native 4K-Generierung)

Direktes Rendern von 3840×2160-Bildern statt Generierung in niedrigerer Auflösung mit anschließendem Hochskalieren. Klings Video-3.0-Modelle führten dies im Mai 2026 ein, mit bis zu 60fps und 15-sekündigen Clips. Siehe Kling natives 4K.

Native Audio (Native Tongenerierung)

Das Modell erzeugt Dialog, Soundeffekte und Musik im selben Durchgang wie die Bildpunkte, statt eine Tonspur nachträglich hinzuzufügen. Kling 3.0 (Februar 2026) beherrscht dies in fünf Sprachen; Hailuo 3.0 liefert Stereo-Audio zu 2K-Clips mit 24fps. Siehe Kling 3.0 und Hailuo 3.0.

Natural Language Processing (NLP)

Die Fähigkeit der KI, menschliche Sprache zu verstehen und zu generieren – verwendet für Skriptanalyse und Voiceovers.

Negative Prompt (Negativer Prompt)

Anweisungen, die der KI sagen, was NICHT in den generierten Inhalt aufgenommen werden soll. Wird verwendet, um unerwünschte Elemente wie unscharfe Bilder, zusätzliche Gliedmaßen oder bestimmte Stile zu vermeiden.

Neural Network (Neuronales Netzwerk)

Die KI-Architektur, die Avatar-Generierung und Sprachsynthese antreibt.

O

Open Weights (Offene Modellgewichte)

Die trainierten Parameter eines Modells werden zum Download veröffentlicht, meist auf Hugging Face, unter einer Lizenz, die die kommerzielle Nutzung einschränken kann; das unterscheidet sich von Open Source, das auch Trainingscode und -daten offenlegt. LTX-2.5 (August 2026) ist Open Weights und für Organisationen mit unter 10 Millionen US-Dollar Jahresumsatz kostenlos; auch Hailuo 3.0 veröffentlichte offene Gewichte. Siehe LTX-2.5.

Overdub

Das Ersetzen vorhandener Dialoge durch neue KI-generierte Sprache bei Beibehaltung des Timings.

Outpainting

Das Erweitern von Videoszenen über ihre ursprünglichen Grenzen hinaus, wobei KI die zusätzlichen Pixel imaginiert.

P

Photorealistic (Fotorealistisch)

Visuelle Qualität, die echter Fotografie oder Videomaterial sehr ähnlich ist.

Pitch (Tonhöhe)

Die Höhe oder Tiefe einer Stimme. Kann bei KI-Stimmgenerierung angepasst werden.

Preset (Voreinstellung)

Vorkonfigurierte Einstellungen oder Vorlagen, die die Videoerstellung beschleunigen.

Q

Quality Threshold (Qualitätsschwelle)

Ein Mindeststandard (Auflösung, Bitrate oder KI-Konfidenzwert), der erreicht werden muss, bevor das Rendering abgeschlossen ist.

Quantization (Quantisierung)

Das Komprimieren von KI-Modellen, damit sie schneller auf Consumer-GPUs laufen, manchmal auf Kosten feiner Details.

R

Real-Time Generation (Echtzeitgenerierung)

Einen Clip in weniger Zeit erzeugen, als der Clip selbst dauert. LTX-2.5 generierte einen 10-sekündigen 720p-Clip in 6,8 Sekunden auf NVIDIA-GB200-Hardware. Siehe LTX-2.5.

Reference Inputs (Referenzeingaben)

Bilder, Clips oder Audio, die zusätzlich zum Prompt geliefert werden, damit das Modell einen Charakter, ein Objekt oder eine Umgebung konsistent hält. Google Veo 3.1 nennt dies „Ingredients to Video”; Hailuo 3.0 akzeptiert bis zu 12 Referenzdateien pro Generierung (höchstens 9 Bilder, 3 Videoclips und 3 Audioclips). Siehe Veo 3.1.

Rendering

Der Prozess der Generierung der endgültigen Videodatei aus Ihrem Skript und Ihren Einstellungen.

Resolution (Auflösung)

Videoqualität gemessen in Pixeln (z.B. 1080p, 4K). Höher = bessere Qualität, aber größere Dateien.

S

Script (Skript)

Der Text, den Ihr KI-Avatar im Video sprechen wird.

Sora

OpenAIs Text-zu-Video-Modell. Die Sora-2-App startete im September 2025 mit generiertem Audio und einer „Cameo”-Funktion; OpenAI stellte App und API am 25. März 2026 ein. Siehe Warum Sora abgeschaltet wurde.

Stem Separation (Stem-Trennung)

KI-Technologie, die eine gemischte Audiospur in einzelne Komponenten (Stems) wie Gesang, Schlagzeug, Bass und andere Instrumente aufteilt. Wird für Remixe, Karaoke und Content-Erstellung verwendet.

Storyboard (Multi-Shot-Generierung)

Mehrere verbundene Einstellungen werden in einer Generierung festgelegt, jede mit eigener Kamera, Dauer und Perspektive, sodass der Clip stimmig zwischen ihnen schneidet. Kling 3.0 erlaubt bis zu sechs Einstellungen in einem 15-sekündigen Clip; LTX-2.5 bringt Multishot-Workflows für ComfyUI mit. Siehe Kling 3.0.

Synthetic Media (Synthetische Medien)

Inhalte (Video, Audio, Bilder), die von KI erstellt oder modifiziert wurden.

Synthesia

Eine führende Enterprise-fokussierte KI-Avatar-Video-Plattform.

SynthID

Googles unsichtbares Wasserzeichen, das in die Pixel oder das Audio generierter Dateien eingebettet wird und auch nach Bearbeitungen, Kompression und Zuschnitt erkennbar bleibt. Es bleibt aktiv, selbst wenn das sichtbare Gemini-Wasserzeichen ausgeschaltet ist (ein Schalter, der am 14. August 2026 eingeführt wurde). Siehe Gemini-Wasserzeichen-Schalter.

T

Temporal Consistency (Zeitliche Konsistenz)

Wie flüssig und kohärent ein KI-generiertes Video visuelle Elemente über Frames hinweg beibehält. Schlechte zeitliche Konsistenz verursacht Flackern, sich verformende Objekte oder Charaktere, die mitten im Video ihr Aussehen ändern.

Text-to-Music

KI-Systeme, die vollständige musikalische Kompositionen aus Textbeschreibungen generieren. Plattformen wie Suno und Udio können Songs mit Gesang, Instrumenten und Produktion aus einfachen Prompts erstellen.

Text-to-Speech (TTS)

Das Umwandeln von geschriebenem Text in gesprochenes Audio mit KI-Stimmen.

Text-to-Video

Das Generieren von Videoinhalten aus einer Textbeschreibung oder einem Skript. Die meisten Modelle von 2026, darunter Kling 3.0 und Hailuo 3.0, erzeugen dabei auch gleich den Soundtrack; siehe Native Audio.

Template (Vorlage)

Vordesignte Video-Layouts, die den Erstellungsprozess beschleunigen.

Thumbnail (Vorschaubild)

Das Vorschaubild, das vor dem Abspielen eines Videos angezeigt wird.

U

Unified Multimodal Model (Einheitliches multimodales Modell)

Eine einzige Engine, die Text-zu-Video, Bild-zu-Video, Bearbeitung und Stilübertragung übernimmt und dabei Text-, Bild-, Video- und Subjekteingaben gemeinsam verarbeitet, statt zwischen spezialisierten Modellen zu wechseln. Kling O1 (30. Dezember 2025) war das erste seiner Art, mit Ausgaben bis 2K bei 30fps in Clips von 3 bis 10 Sekunden. Siehe Kling O1.

Upscaling (Hochskalierung)

Die Verwendung von KI zur Erhöhung der Auflösung eines fertigen Videos, zum Beispiel von 1080p auf 4K. Vergleiche Native 4K, wo das Modell die Bilder direkt in voller Auflösung rendert.

V

Video-to-Video (vid2vid)

Transformation von bestehendem Videomaterial mit KI, um dessen Stil, Aussehen oder Inhalt zu ändern, während die ursprüngliche Bewegung und Struktur erhalten bleibt.

Voice Cloning (Stimmenklonen)

Das Erstellen einer synthetischen Version der Stimme einer Person, die jeden Text sprechen kann.

Voice Modulation (Stimmmodulation)

Das Anpassen von Stimmeigenschaften wie Tonhöhe, Geschwindigkeit und Emotion.

VTT/SRT

Untertiteldateiformate zum Hinzufügen von Untertiteln zu Videos.

W

Watermark (Wasserzeichen)

Ein sichtbares Logo oder Text-Overlay, häufig bei kostenlosen Plänen und Testversionen. Zu unterscheiden von unsichtbaren Markierungen wie SynthID und Herkunftsmetadaten wie C2PA, die eingebettet bleiben, auch wenn die sichtbare Markierung deaktiviert ist.

Workflow (Arbeitsablauf)

Die Schrittfolge vom Skript zum fertigen Video.

X

XR (Extended Reality)

Ein Oberbegriff für AR, VR und Mixed Reality. KI-Avatare werden oft in XR-Erlebnisse übertragen.

XML Subtitle (XML-Untertitel)

Zeitgesteuerte Textdateien (wie TTML), die aus KI-Untertitelungstools für Broadcast-Workflows exportiert werden.

Y

YUV Color Space (YUV-Farbraum)

Das Farbmodell, das die meisten Streaming-Plattformen verwenden. Hilfreich beim Exportieren von KI-Material für Broadcast-Standards.

YouTube Shorts

Vertikale Videos unter 60 Sekunden. Viele KI-Videogeneratoren liefern Shorts-Voreinstellungen mit.

Z

Zero-Shot Generation (Zero-Shot-Generierung)

Das Produzieren eines überzeugenden Videos oder einer Stimme ohne Bereitstellung von Beispielmaterial oder Audio des Zielsubjekts.

Zoom Recording Import (Zoom-Aufnahme-Import)

Das Hochladen einer Zoom-Besprechung in einen KI-Editor, damit dieser schneiden, übersetzen oder in geskriptete Clips umwandeln kann.

Fazit

Dieses Glossar deckt die wesentlichen Begriffe ab, denen Sie bei der Arbeit mit KI-Videogenerierungstools begegnen werden. Mit der Weiterentwicklung der Technologie werden neue Begriffe entstehen – ich halte diesen Leitfaden aktuell!

Speichern Sie diese Seite für schnelle Referenz beim Erstellen Ihrer KI-Videos.


Fehlt ein Begriff? Kontaktieren Sie mich, um Ergänzungen vorzuschlagen!

War dieser Artikel hilfreich?

0:00