Glossaire pratique • IA générative

Glossaire IA : les mots essentiels de l’intelligence artificielle

Comprenez simplement le vocabulaire de l’IA générative, de ChatGPT, de la création d’images et de la vidéo IA. Chaque terme est expliqué sans jargon, avec un exemple concret pour passer rapidement de la théorie à la pratique.

Définitions simples Exemples concrets Image et vidéo IA Accessible aux débutants

Comprendre les bases

Commencez par IA générative, modèle, LLM, prompt et token pour comprendre comment fonctionnent les outils comme ChatGPT.

Créer des visuels

Découvrez les notions indispensables pour générer des images cohérentes : diffusion, seed, référence, LoRA et upscaling.

Produire des vidéos IA

Maîtrisez le vocabulaire du text-to-video, de l’image-to-video, des keyframes, de l’interpolation et du lip sync.

Définitions de l’IA générative

Un guide clair pour comprendre les principaux termes utilisés dans les outils de texte, d’image, de son, d’automatisation et de vidéo par intelligence artificielle.

Agent IA

Fondamentaux

Un agent IA est un système capable de recevoir un objectif, de choisir des actions et d’utiliser des outils pour accomplir une tâche avec un certain degré d’autonomie.

Exemple : un agent peut lire un brief, rechercher des informations, rédiger un plan puis enregistrer le résultat dans un document.

Algorithme

Fondamentaux

Un algorithme est une suite d’instructions permettant à un ordinateur de traiter des informations, résoudre un problème ou produire un résultat.

Exemple : un algorithme peut classer des images, recommander une vidéo ou détecter un objet dans une scène.

API

Technique

Une API est une interface qui permet à plusieurs logiciels de communiquer. Elle sert souvent à connecter un modèle IA à un site, une application ou un workflow automatisé.

Exemple : une API peut envoyer un prompt à un modèle et récupérer automatiquement l’image ou le texte généré.

Chatbot

Texte

Un chatbot est un programme conçu pour dialoguer avec une personne par texte ou par voix. Les chatbots modernes peuvent s’appuyer sur des LLM.

Exemple : un assistant capable de répondre aux questions d’un client à partir d’une base de connaissances.

Cohérence visuelle

Image & vidéo

La cohérence visuelle désigne la capacité à conserver le même personnage, produit, décor ou style d’une génération à l’autre.

Exemple : garder le même visage, la même tenue et les mêmes proportions dans dix plans successifs.

Contexte / fenêtre de contexte

Texte

La fenêtre de contexte correspond à la quantité d’informations qu’un modèle peut prendre en compte en une seule fois pour produire sa réponse.

Exemple : une grande fenêtre de contexte permet d’analyser un long script sans oublier son début.

Diffusion

Image IA

Un modèle de diffusion apprend à créer une image en partant d’un bruit aléatoire qu’il transforme progressivement selon les instructions du prompt.

Exemple : de nombreux générateurs d’images produisent une scène en retirant progressivement le bruit jusqu’au rendu final.

Deep Learning

Fondamentaux

Le Deep Learning, ou apprentissage profond, utilise des réseaux de neurones composés de nombreuses couches pour apprendre des structures complexes dans les données.

Exemple : reconnaître un visage, générer une voix ou comprendre une scène vidéo.

Embedding

Technique

Un embedding transforme un texte, une image ou un autre contenu en une représentation numérique permettant de comparer leur sens ou leur proximité.

Exemple : retrouver les passages d’un document les plus proches d’une question, même sans reprendre exactement les mêmes mots.

Frame

Vidéo IA

Une frame est une image individuelle composant une vidéo. La fréquence d’images, exprimée en FPS, indique combien de frames sont affichées chaque seconde.

Exemple : une vidéo à 25 FPS contient 25 images pour chaque seconde affichée.

Frame interpolation

Vidéo IA

La frame interpolation crée des images intermédiaires entre deux frames existantes pour rendre un mouvement plus fluide ou fabriquer un ralenti.

Exemple : transformer une animation saccadée en mouvement plus naturel sans régénérer toute la scène.

IA générative

Fondamentaux

L’IA générative désigne les modèles capables de produire de nouveaux contenus : texte, image, vidéo, voix, musique, code ou objets 3D.

Exemple : écrire un script, créer une publicité visuelle ou transformer une photo en séquence vidéo.

Image-to-video

Vidéo IA

L’image-to-video consiste à transformer une image fixe en vidéo en ajoutant du mouvement au sujet, au décor ou à la caméra.

Exemple : animer une photo immobilière avec un travelling avant et des mouvements réalistes de lumière.

Inpainting

Image IA

L’inpainting permet de modifier seulement une zone sélectionnée d’une image : supprimer un élément, réparer une partie ou ajouter un objet.

Exemple : remplacer un canapé sans toucher à l’architecture ni au reste de la pièce.

Keyframe

Vidéo IA

Une keyframe, ou image clé, définit un état important d’une animation : position de départ, position d’arrivée, cadrage ou apparence.

Exemple : fournir une première et une dernière image pour guider la transformation entre deux plans.

LLM

Texte

Un LLM, ou Large Language Model, est un modèle entraîné sur de très grands volumes de texte pour comprendre et générer du langage.

Exemple : rédiger un script, résumer un document, traduire un texte ou construire un plan de contenu.

LoRA

Image IA

Une LoRA est une adaptation légère d’un modèle permettant de lui apprendre un style, un personnage, un produit ou une apparence spécifique sans le réentraîner entièrement.

Exemple : reproduire plus régulièrement un personnage ou une identité visuelle dans plusieurs images.

Lip sync

Vidéo IA

Le lip sync, ou synchronisation labiale, ajuste les mouvements de la bouche d’un personnage afin qu’ils correspondent à une voix ou à un dialogue.

Exemple : faire parler un avatar ou un personnage dans une autre langue en synchronisant ses lèvres.

Machine Learning

Fondamentaux

Le Machine Learning, ou apprentissage automatique, permet à un système d’apprendre des règles et des tendances à partir de données plutôt que d’être programmé uniquement à la main.

Exemple : apprendre à distinguer automatiquement une maison, une voiture et une personne dans une image.

Modèle IA

Fondamentaux

Un modèle IA est un système entraîné à reconnaître des structures dans les données et à produire une prédiction, une décision ou un contenu.

Exemple : un modèle de texte ne fonctionne pas comme un modèle conçu pour générer de la vidéo.

Negative prompt

Prompt

Un negative prompt décrit les éléments que l’on souhaite éviter dans une génération, lorsque l’outil utilisé prend cette fonction en charge.

Exemple : exclure les textes illisibles, les mains déformées, le flou ou certains styles visuels.

Prompt

Fondamentaux

Un prompt est l’instruction donnée à un modèle d’intelligence artificielle. Il peut préciser l’objectif, le contexte, le style, les contraintes et le format du résultat.

Exemple : décrire le sujet, l’éclairage, le cadrage, le mouvement de caméra et l’ambiance d’une scène vidéo.

Prompt engineering

Prompt

Le prompt engineering consiste à structurer et tester les instructions afin d’obtenir des résultats plus précis, cohérents et reproductibles.

Exemple : séparer clairement le sujet, l’action, la caméra, la lumière, le style et les contraintes techniques.

RAG

Technique

Le RAG combine un modèle de langage avec une recherche dans des documents ou une base de connaissances afin de produire une réponse fondée sur des informations récupérées.

Exemple : un assistant répond aux questions d’une entreprise à partir de ses procédures internes.

Référence d’image

Image & vidéo

Une référence d’image sert à guider un modèle sur l’identité d’un sujet, sa composition, son style, ses couleurs ou son environnement.

Exemple : fournir la photo réelle d’une maison afin de préserver son architecture pendant la génération.

Réseau neuronal

Fondamentaux

Un réseau neuronal est une architecture de calcul composée de couches d’unités interconnectées, utilisée pour apprendre des relations complexes dans les données.

Exemple : identifier des formes, comprendre une phrase ou prédire l’image suivante d’une séquence.

Seed

Image IA

La seed, ou graine aléatoire, est un nombre utilisé pour initialiser une génération. Avec les mêmes réglages, elle peut aider à reproduire ou faire varier un résultat.

Exemple : conserver une seed pour tester plusieurs variantes d’un prompt à partir d’une base proche.

Storyboard

Vidéo IA

Un storyboard est une suite d’images représentant les principaux plans d’une vidéo avant sa production. Il aide à organiser le cadrage, l’action et le rythme.

Exemple : préparer six plans cohérents avant de générer chaque séquence avec un outil vidéo IA.

Text-to-video

Vidéo IA

Le text-to-video génère une séquence vidéo directement à partir d’une description écrite, sans imposer obligatoirement une image de départ.

Exemple : créer un plan cinématographique en décrivant le lieu, l’action, la caméra, la lumière et l’atmosphère.

Text-to-image

Image IA

Le text-to-image transforme une instruction écrite en image. La précision du sujet, du style et de la composition influence fortement le résultat.

Exemple : générer une photographie publicitaire, un concept architectural ou une illustration à partir d’un prompt.

Token

Texte

Un token est une petite unité de texte traitée par un modèle de langage. Un mot peut correspondre à un seul token ou être découpé en plusieurs morceaux.

Exemple : la longueur d’un prompt et d’une réponse est souvent mesurée en tokens plutôt qu’en mots.

Training / entraînement

Fondamentaux

L’entraînement est la phase pendant laquelle un modèle ajuste ses paramètres en analysant de grandes quantités de données.

Exemple : un modèle d’image apprend progressivement les relations entre les mots, les formes, les textures et les styles.

Upscaling

Image & vidéo

L’upscaling augmente la résolution d’une image ou d’une vidéo. Les outils IA peuvent aussi reconstruire certains détails pendant l’agrandissement.

Exemple : agrandir une image générée pour une miniature ou une impression sans conserver un rendu trop pixelisé.

Vidéo IA

Vidéo IA

La vidéo IA regroupe les techniques utilisant l’intelligence artificielle pour générer, transformer, animer, monter ou améliorer des séquences vidéo.

Exemple : transformer des photos en visite immobilière, créer des plans impossibles à filmer ou modifier un décor.

Workflow IA

Technique

Un workflow IA est une suite organisée d’étapes et d’outils permettant de réaliser une tâche de manière répétable, manuelle ou automatisée.

Exemple : idée → script → storyboard → images → animation → voix → montage → publication.
Aucune définition ne correspond à votre recherche. Essayez un terme plus général comme « vidéo », « prompt », « image » ou « ChatGPT ».
Passer de la définition à la création

Apprenez à créer des images et des vidéos avec l’IA

Retrouvez sur mon site mes ressources, méthodes et contenus consacrés à la création IA : prompting, génération d’images, vidéo IA, storytelling, montage et monétisation de compétences créatives.

Explorer le site de Karim

Questions fréquentes sur l’intelligence artificielle

Qu’est-ce que l’intelligence artificielle générative ?

L’intelligence artificielle générative désigne les modèles capables de créer de nouveaux contenus à partir d’instructions ou de données de référence : texte, image, vidéo, musique, voix ou code.

Quelle différence entre IA, Machine Learning et Deep Learning ?

L’intelligence artificielle est le domaine général. Le Machine Learning est une manière de construire des systèmes qui apprennent à partir de données. Le Deep Learning est une famille de techniques de Machine Learning utilisant des réseaux neuronaux profonds.

Comment apprendre à créer des vidéos avec l’IA ?

Commencez par le storyboard et le cadrage, puis apprenez le prompting visuel, le text-to-image, l’image-to-video, les mouvements de caméra, la cohérence des personnages et enfin le montage. Un bon workflow compte davantage que l’utilisation isolée d’un seul outil.

Un prompt très long donne-t-il toujours un meilleur résultat ?

Non. Un bon prompt est surtout clair, structuré et adapté au modèle utilisé. Ajouter des détails contradictoires ou inutiles peut rendre le résultat moins cohérent.

Quelle est la différence entre text-to-video et image-to-video ?

Le text-to-video part principalement d’une description écrite. L’image-to-video utilise une image comme point de départ, ce qui offre généralement davantage de contrôle sur l’identité visuelle, la composition et le sujet.

Glossaire proposé par Karim / Sat0oshi — créateur, formateur et réalisateur IA. Découvrir le site.