AI動画生成用語集:必須用語の解説
最適な方: AI駆動コンテンツをスクリプティングする際に簡単なリファレンスが必要な製品マーケター、オペレーションチーム、代理店ライター、インフルエンサー。
2026年の新規追加: この用語集は2026年9月に、2026年のモデルの仕組みとAI出力をめぐる規制に関する15語を加えて拡張しました。AIコンテンツ表示ラベル、AI DAW、C2PA、クレジット、識別不能閾値、モーションコントロール、ネイティブオーディオ、ネイティブ4K、オープンウェイト、リアルタイム生成、参照入力、Sora、ストーリーボード、SynthID、統合マルチモーダルモデルの15語です。
A
AIアバター(AI Avatar)
人工知能によって生成され、リアルに話したり動いたりできるデジタルキャラクター。動画で人間の俳優の代わりに使用されます。
AIコンテンツ表示ラベル(AI Content Label)
動画、画像、音声ファイルがAIによって生成されたことを、視聴者に見える形で開示する表示です。EUのAI法第50条とカリフォルニア州のSB 942は2026年8月2日から適用され、EUではさらに機械可読な標識の付与(すでに市場に出ているシステムは2026年12月2日まで)も求められ、違反には最大1500万ユーロまたは売上高の3%の制裁金が科されます。詳しくはEU AI法第50条の解説をご覧ください。
AI DAW
生成機能を最初から組み込んだブラウザベースのDAW(デジタル・オーディオ・ワークステーション)で、プロンプト、ステム、MIDI、ミキシングが1つのプロジェクトにまとまります。Suno Studio 2.0(2026年8月13日)はMIDIの録音・編集、AIチャットによる共同制作、カスタムプラグインを追加し、MIDIクリップをプロンプトとして使えるようにしました。詳しくはSuno Studio 2.0をご覧ください。
オーディオインペインティング(Audio Inpainting)
AIを使用して、ギャップを埋めたり、不要な音を除去したり、音声録音の損傷したセクションを自然な流れを維持しながら修復すること。
オーディオ合成(Audio Synthesis)
本物の人の声を録音する代わりに、AIを使用して人間のようなスピーチを生成するプロセス。
アスペクト比(Aspect Ratio)
動画の幅と高さの比率(例:ワイドスクリーン用16:9、縦型/モバイル用9:16)。
B
背景除去(Background Removal)
動画映像から自動的に背景を除去し、カスタムシーンに置き換えることを可能にするAI技術。
バッチ生成(Batch Generation)
異なるスクリプトやテンプレートから複数の動画を同時に作成すること。
ブランドキット(Brand Kit)
動画全体で一貫したブランディングを維持するために使用されるロゴ、色、フォント、アセットのコレクション。
C
C2PA(Content Credentials)
ファイルがAIによって生成されたこと、どのツールで作られたかを記録する来歴メタデータを付与するオープン標準で、通常の視聴では見えません。GoogleはGeminiの出力に、目に見えるウォーターマークをオフにした場合でもこれを埋め込み、Synthesiaは標準で付与しています。詳しくはGeminiのウォーターマーク切り替えをご覧ください。
CFGスケール(Classifier-Free Guidance)
AIがプロンプトにどれだけ忠実に従うかを制御するパラメータ。高い値は説明に忠実な出力を生成し、低い値はより創造的な自由を許容します。
チェックポイント(Checkpoint)
AIモデルの学習済み重みの保存状態。異なるチェックポイントは異なる視覚スタイルや機能を生成できます。
クローンボイス(Clone Voice)
オリジナルの声の特徴を維持しながら、任意のテキストを話すことができる人の声の合成コピーを作成すること。
ControlNet
ポーズ、エッジ、深度マップ、その他の視覚ガイドのための参照画像を使用して、AI画像・動画生成を正確に制御する技術。
クレジット(Credits)
多くのジェネレーターが採用している課金単位で、1本のクリップに必要なクレジット数は解像度と長さに応じて増えるため、月額プランは実質的に1か月あたりの秒数の予算になります。たとえばRunwayでのHailuo 3.0は、2K動画1秒あたり15クレジットです。詳しくはRunwayのHailuo 3.0をご覧ください。
カスタムアバター(Custom Avatar)
特定の人物の映像から作成され、そのデジタル肖像を表すパーソナライズされたAIアバター。
D
ディープフェイク(Deepfake)
顔を入れ替えたりコンテンツを変更したりする動画操作技術。同意なしに使用された場合は問題あり(倫理的なAIアバターとは異なる)。2026年8月2日以降、EUのルールではディープフェイクに目に見えるAIコンテンツ表示ラベルを付けることが義務づけられています。
拡散モデル(Diffusion Model)
Kling、Veo、Runwayなどの最新の動画ジェネレーターを動かすAIアーキテクチャ(Soraは2026年3月に提供終了)。ランダムなノイズからノイズを除去することを学習し、一貫した画像や動画が出現するまで処理します。
デジタルヒューマン(Digital Human)
AIアバターの別名 - 人間のように見え、行動するコンピュータ生成の人物。
吹き替え(Dubbing)
動画のオリジナルオーディオを別の言語に置き換え、リップの動きを同期させること。
E
エッジケース(Edge Cases)
AIが最適に機能しない可能性がある異常または稀なシナリオ(例:珍しい発音)。
エクスポートフォーマット(Export Format)
動画が保存されるファイルタイプ(例:MP4、MOV、WebM)。
F
フェイススワップ(Face Swap)
動画内である人の顔を別の人の顔に置き換える技術。
ファインチューニング(Fine-tuning)
事前学習済みのAIモデルを取り、特定のデータでさらに学習させて、特定のタスク、スタイル、または主題に特化させるプロセス。
フレームレート(Frame Rate)
動画で1秒あたりに表示される画像(フレーム)の数。標準は24〜30fps。
フロントエンド/バックエンド(Frontend/Backend)
フロントエンドはユーザーが見るもの、バックエンドは裏で行われるAI処理を指す。
G
生成AI(Generative AI)
既存のコンテンツを分析するだけでなく、新しいコンテンツ(画像、動画、オーディオ)を作成するAI。
ジェスチャーコントロール(Gesture Control)
アバターの手の動きやボディランゲージをプログラムする機能。
グリーンスクリーン(Green Screen)
単色の背景(通常は緑)を他の映像に置き換える技術。AIは今これを自動的に行えます。
H
ハルシネーション(Hallucination)
AIが虚偽、ナンセンス、または事実に反するコンテンツを生成すること。動画では、歪んだ手、不可能な物理法則、または不自然に変形する顔として現れることがあります。
ハイパーリアリスティック(Hyper-Realistic)
本物の映像と区別することが非常に難しいAI生成コンテンツ。視聴者がまったく見分けられなくなった時点で、その出力は識別不能閾値を超えたことになります。
HeyGen
ボイスクローニングと使いやすさで知られる人気のAIアバター動画プラットフォーム。
I
画像から動画へ(Image-to-Video / img2vid)
単一の静止画像から動画コンテンツを生成すること。AIが静止画像をアニメーション化し、動き、カメラの動き、またはキャラクターアニメーションを追加します。
識別不能閾値(Indistinguishability Threshold)
AIが生成したメディアと本物の録音・録画を、人が確実には見分けられなくなる地点のことです。ボイスクローニングは2025年にこの地点を越えており、バッファロー大学のSiwei Lyu氏が指摘するとおり、数秒の音声から自然な抑揚、強調、間の取り方、息づかいまで備えたクローンが作れるようになりました。詳しくは2025年のディープフェイク総括をご覧ください。
推論(Inference)
学習済みAIモデルを実行して出力を生成するプロセス。AIツールで動画を作成するとき、その生成プロセスを推論と呼びます。
インペインティング(Inpainting)
AIを使用して動画フレームの一部を埋めたり修正したりすること。
インスタントアバター(Instant Avatar)
カスタムトレーニングなしですぐに使える事前作成のAIアバター。
J
Jカット(J-Cut)
次のシーンのオーディオが現在のビジュアルが終わる前に再生を開始する編集技術。AI生成シーンをより自然に感じさせるのに役立ちます。
ジッターリダクション(Jitter Reduction)
AI生成映像のわずかなカメラの揺れやフレーム間のノイズを除去する安定化フィルター。
K
キーフレーム(Keyframe)
アニメーション、カメラ位置、またはエフェクトの変化を示すフレーム。多くのAI動画エディターでアバターのポーズやカメラの動きをキーフレーム化できます。
知識カットオフ(Knowledge Cutoff)
生成AIモデルがトレーニングされた最新の日付。AIツールがスクリプト内で事実を引用する際に重要。
L
レイテンシー(Latency)
動画生成を開始してから完成品を受け取るまでの遅延。
リップシンク(Lip-Sync)
アバターの口の動きを話される言葉に一致させること。リアルな動画に重要。
LLM(大規模言語モデル)
スクリプトの作成や動画コンテンツの生成に役立つGPTなどのAIモデル。
LoRA(Low-Rank Adaptation)
AIモデル全体ではなく小さなアダプターモジュールを学習する軽量なファインチューニング技術。動画ジェネレーターにカスタムスタイル、キャラクター、またはコンセプトを追加するのに人気です。
M
モーションキャプチャー(Motion Capture)
アバターをより自然に動かすために本物の人間の動きを記録すること。
モーションコントロール(Motion Control)
実際の演技を撮影した参照動画を使って、生成したキャラクターに同じ動きをさせる機能です。Kling VIDEO 2.6(2025年12月)は3秒から30秒の参照動画を受け付け、全身、手、表情まで追従します。詳しくはKlingのモーションコントロールをご覧ください。
多言語サポート(Multi-Language Support)
ネイティブな発音で多くの異なる言語で動画を作成する能力。
MP4
最も一般的な動画ファイル形式で、すべてのプラットフォームと広く互換性があります。
マルチモーダル(Multimodal)
テキスト、画像、オーディオ、動画など複数のタイプのコンテンツを単一システム内で理解・生成できるAIモデル。例:GPT-4VとGemini。テキスト、画像、動画、音声を1つのエンジンにまとめた動画ジェネレーターについては、統合マルチモーダルモデルを参照してください。
N
ネイティブ4K(Native 4K)
低い解像度で生成してからアップスケールするのではなく、3840×2160のフレームを直接レンダリングすることです。KlingのVideo 3.0系は2026年5月にこれへ対応し、最大60fps、15秒までのクリップを生成できます。詳しくはKlingのネイティブ4K生成をご覧ください。
ネイティブオーディオ(Native Audio)
セリフ、効果音、音楽を後からボイストラックとして足すのではなく、映像と同じ生成パスの中でモデルが作り出すことです。Kling 3.0(2026年2月)は5言語でこれに対応し、Hailuo 3.0は2K・24fpsのクリップとあわせてステレオ音声を返します。詳しくはKling 3.0とHailuo 3.0をご覧ください。
自然言語処理(NLP)
AIが人間の言語を理解し生成する能力 - スクリプト分析やナレーションに使用。
ネガティブプロンプト(Negative Prompt)
生成されたコンテンツに何を含めないかをAIに指示する指示。ぼやけた画像、余分な手足、または特定のスタイルなど不要な要素を避けるために使用されます。
ニューラルネットワーク(Neural Network)
アバター生成と音声合成を動かすAIアーキテクチャ。
O
オープンウェイト(Open Weights)
モデルの学習済みパラメータが、多くはHugging Face上で、商用利用を制限する場合のあるライセンスのもとに公開されていることを指し、学習コードとデータまで公開するオープンソースとは区別されます。LTX-2.5(2026年8月)はオープンウェイトで、年間売上1000万ドル未満の組織は無料で利用でき、Hailuo 3.0もオープンウェイトを公開しました。詳しくはLTX-2.5をご覧ください。
オーバーダブ(Overdub)
タイミングをそのままに、既存のセリフを新しいAI生成スピーチに置き換えること。
アウトペインティング(Outpainting)
AIを使用して追加のピクセルを想像し、動画シーンを元の境界を超えて拡張すること。
P
フォトリアリスティック(Photorealistic)
本物の写真や動画映像に酷似した視覚品質。
ピッチ(Pitch)
声の高低。AI音声生成で調整可能。
プリセット(Preset)
動画作成を高速化する事前設定された設定やテンプレート。
Q
品質閾値(Quality Threshold)
レンダリングが完了する前に満たす必要のある最低基準(解像度、ビットレート、またはAI信頼スコア)。
量子化(Quantization)
AIモデルを圧縮して消費者向けGPUでより速く実行できるようにすること、時には細部を犠牲にします。
R
リアルタイム生成(Real-Time Generation)
クリップの長さよりも短い実時間で生成を終えることです。LTX-2.5はNVIDIA GB200のハードウェア上で、10秒の720pクリップを6.8秒で生成しました。詳しくはLTX-2.5をご覧ください。
参照入力(Reference Inputs)
キャラクター、物体、舞台設定の一貫性を保つために、プロンプトと一緒に渡す画像・動画クリップ・音声のことです。GoogleのVeo 3.1はこれをIngredients to Videoと呼び、Hailuo 3.0は1回の生成につき最大12ファイル(画像9点、動画クリップ3点、音声3点まで)を受け付けます。詳しくはVeo 3.1をご覧ください。
レンダリング(Rendering)
スクリプトと設定から最終動画ファイルを生成するプロセス。
解像度(Resolution)
ピクセルで測定される動画品質(例:1080p、4K)。高い = より良い品質だが、より大きなファイル。
S
スクリプト(Script)
AIアバターが動画で話すテキスト。
Sora
OpenAIのテキストから動画を生成するモデルです。Sora 2アプリは2025年9月に、生成音声とカメオ機能を備えて公開されましたが、OpenAIは2026年3月25日にアプリとAPIの両方を終了しました。詳しくはSoraが終了した理由をご覧ください。
ステム分離(Stem Separation)
ミックスされたオーディオトラックをボーカル、ドラム、ベース、その他の楽器などの個々のコンポーネント(ステム)に分割するAI技術。リミックス、カラオケ、コンテンツ制作に使用されます。
ストーリーボード(Storyboard / Multi-Shot Generation)
つながりのある複数のショットを1回の生成でまとめて指定し、それぞれにカメラ、長さ、視点を持たせることで、クリップ内のカットが自然につながるようにする機能です。Kling 3.0は15秒のクリップの中に最大6ショットを置くことができ、LTX-2.5はComfyUI向けのマルチショットワークフローを提供しています。詳しくはKling 3.0をご覧ください。
合成メディア(Synthetic Media)
AIによって作成または修正されたコンテンツ(動画、オーディオ、画像)。
Synthesia
エンタープライズ向けの主要なAIアバター動画プラットフォーム。
SynthID
生成されたファイルのピクセルや音声に埋め込まれる、Googleの目に見えないウォーターマークで、編集、圧縮、トリミングを経ても検出できます。Geminiの目に見えるウォーターマークをオフにしても(この切り替えは2026年8月14日に追加されました)、そのまま残ります。詳しくはGeminiのウォーターマーク切り替えをご覧ください。
T
時間的一貫性(Temporal Consistency)
AI生成動画がフレーム間で視覚要素をどれだけスムーズかつ一貫して維持するか。時間的一貫性が低いと、フリッカー、変形するオブジェクト、または動画の途中で外観が変わるキャラクターが発生します。
テキストから音楽へ(Text-to-Music)
テキスト説明から完全な音楽作品を生成するAIシステム。SunoやUdioなどのプラットフォームは、シンプルなプロンプトからボーカル、楽器、プロダクション付きの曲を作成できます。
テキスト読み上げ(TTS)
AIボイスを使用して書かれたテキストを音声に変換すること。
テキストから動画(Text-to-Video)
テキストの説明やスクリプトから動画コンテンツを生成すること。Kling 3.0やHailuo 3.0をはじめ、2026年のモデルの多くは同じパスでサウンドトラックも生成します(ネイティブオーディオを参照)。
テンプレート(Template)
作成プロセスを高速化する事前デザインされた動画レイアウト。
サムネイル(Thumbnail)
動画が再生される前に表示されるプレビュー画像。
U
統合マルチモーダルモデル(Unified Multimodal Model)
テキストから動画、画像から動画、編集、スタイル転送までを1つのエンジンで扱い、専用モデルを切り替える代わりに、テキスト・画像・動画・被写体の入力をまとめて受け取るモデルです。Kling O1(2025年12月30日)がその最初の例で、3秒から10秒のクリップを最大2K・30fpsで出力します。詳しくはKling O1をご覧ください。
アップスケーリング(Upscaling)
AIを使って、完成した動画の解像度を上げること(たとえば1080pから4Kへ)。モデルがフル解像度のフレームを直接描き出すネイティブ4Kとは異なります。
V
動画から動画へ(Video-to-Video / vid2vid)
AIを使用して既存の動画映像を変換し、元の動きと構造を維持しながらスタイル、外観、またはコンテンツを変更すること。
ボイスクローニング(Voice Cloning)
任意のテキストを話すことができる誰かの声の合成バージョンを作成すること。
ボイスモジュレーション(Voice Modulation)
ピッチ、速度、感情などの声の特性を調整すること。
VTT/SRT
動画にキャプションを追加するための字幕ファイル形式。
W
ウォーターマーク(Watermark)
動画上に表示されるロゴやテキストのオーバーレイで、無料プランや体験版でよく使われます。SynthIDのような目に見えない標識や、C2PAのような来歴メタデータとは別物で、こちらは目に見える表示をオフにしても埋め込まれたまま残ります。
ワークフロー(Workflow)
スクリプトから完成動画までの一連のステップ。
X
XR(エクステンデッドリアリティ)
AR、VR、ミックスドリアリティの総称。AIアバターはしばしばXR体験に移植されます。
XML字幕
放送ワークフロー用にAIキャプションツールからエクスポートされるタイムドテキストファイル(TTMLなど)。
Y
YUVカラースペース
ほとんどのストリーミングプラットフォームが使用するカラーモデル。AI映像を放送基準に合わせてエクスポートする際に役立ちます。
YouTube Shorts
縦型で60秒以下の動画。多くのAI動画ジェネレーターにはShortsプリセットが付属しています。
Z
ゼロショット生成(Zero-Shot Generation)
対象のサンプル映像やオーディオを提供せずに説得力のある動画や音声を生成すること。
Zoom録画インポート
ZoomミーティングをアIエディターにアップロードして、トリミング、翻訳、またはスクリプト化されたクリップに変換すること。
まとめ
この用語集は、AI動画生成ツールを使用する際に遭遇する必須用語をカバーしています。技術が進化するにつれて、新しい用語が登場します - このガイドを更新し続けます!
このページをブックマークして、AI動画を作成する際のクイックリファレンスとしてお使いください。
用語が見つからない?追加を提案するにはお問い合わせください!