Comprendre les bases
Commencez par IA générative, modèle, LLM, prompt et token pour comprendre comment fonctionnent les outils comme ChatGPT.
Comprenez simplement le vocabulaire de l’IA générative, de ChatGPT, de la création d’images et de la vidéo IA. Chaque terme est expliqué sans jargon, avec un exemple concret pour passer rapidement de la théorie à la pratique.
Commencez par IA générative, modèle, LLM, prompt et token pour comprendre comment fonctionnent les outils comme ChatGPT.
Découvrez les notions indispensables pour générer des images cohérentes : diffusion, seed, référence, LoRA et upscaling.
Maîtrisez le vocabulaire du text-to-video, de l’image-to-video, des keyframes, de l’interpolation et du lip sync.
Un guide clair pour comprendre les principaux termes utilisés dans les outils de texte, d’image, de son, d’automatisation et de vidéo par intelligence artificielle.
Un agent IA est un système capable de recevoir un objectif, de choisir des actions et d’utiliser des outils pour accomplir une tâche avec un certain degré d’autonomie.
Un algorithme est une suite d’instructions permettant à un ordinateur de traiter des informations, résoudre un problème ou produire un résultat.
Une API est une interface qui permet à plusieurs logiciels de communiquer. Elle sert souvent à connecter un modèle IA à un site, une application ou un workflow automatisé.
Un chatbot est un programme conçu pour dialoguer avec une personne par texte ou par voix. Les chatbots modernes peuvent s’appuyer sur des LLM.
La cohérence visuelle désigne la capacité à conserver le même personnage, produit, décor ou style d’une génération à l’autre.
La fenêtre de contexte correspond à la quantité d’informations qu’un modèle peut prendre en compte en une seule fois pour produire sa réponse.
Un modèle de diffusion apprend à créer une image en partant d’un bruit aléatoire qu’il transforme progressivement selon les instructions du prompt.
Le Deep Learning, ou apprentissage profond, utilise des réseaux de neurones composés de nombreuses couches pour apprendre des structures complexes dans les données.
Un embedding transforme un texte, une image ou un autre contenu en une représentation numérique permettant de comparer leur sens ou leur proximité.
Une frame est une image individuelle composant une vidéo. La fréquence d’images, exprimée en FPS, indique combien de frames sont affichées chaque seconde.
La frame interpolation crée des images intermédiaires entre deux frames existantes pour rendre un mouvement plus fluide ou fabriquer un ralenti.
L’IA générative désigne les modèles capables de produire de nouveaux contenus : texte, image, vidéo, voix, musique, code ou objets 3D.
L’image-to-video consiste à transformer une image fixe en vidéo en ajoutant du mouvement au sujet, au décor ou à la caméra.
L’inpainting permet de modifier seulement une zone sélectionnée d’une image : supprimer un élément, réparer une partie ou ajouter un objet.
Une keyframe, ou image clé, définit un état important d’une animation : position de départ, position d’arrivée, cadrage ou apparence.
Un LLM, ou Large Language Model, est un modèle entraîné sur de très grands volumes de texte pour comprendre et générer du langage.
Une LoRA est une adaptation légère d’un modèle permettant de lui apprendre un style, un personnage, un produit ou une apparence spécifique sans le réentraîner entièrement.
Le lip sync, ou synchronisation labiale, ajuste les mouvements de la bouche d’un personnage afin qu’ils correspondent à une voix ou à un dialogue.
Le Machine Learning, ou apprentissage automatique, permet à un système d’apprendre des règles et des tendances à partir de données plutôt que d’être programmé uniquement à la main.
Un modèle IA est un système entraîné à reconnaître des structures dans les données et à produire une prédiction, une décision ou un contenu.
Un negative prompt décrit les éléments que l’on souhaite éviter dans une génération, lorsque l’outil utilisé prend cette fonction en charge.
Un prompt est l’instruction donnée à un modèle d’intelligence artificielle. Il peut préciser l’objectif, le contexte, le style, les contraintes et le format du résultat.
Le prompt engineering consiste à structurer et tester les instructions afin d’obtenir des résultats plus précis, cohérents et reproductibles.
Le RAG combine un modèle de langage avec une recherche dans des documents ou une base de connaissances afin de produire une réponse fondée sur des informations récupérées.
Une référence d’image sert à guider un modèle sur l’identité d’un sujet, sa composition, son style, ses couleurs ou son environnement.
Un réseau neuronal est une architecture de calcul composée de couches d’unités interconnectées, utilisée pour apprendre des relations complexes dans les données.
La seed, ou graine aléatoire, est un nombre utilisé pour initialiser une génération. Avec les mêmes réglages, elle peut aider à reproduire ou faire varier un résultat.
Un storyboard est une suite d’images représentant les principaux plans d’une vidéo avant sa production. Il aide à organiser le cadrage, l’action et le rythme.
Le text-to-video génère une séquence vidéo directement à partir d’une description écrite, sans imposer obligatoirement une image de départ.
Le text-to-image transforme une instruction écrite en image. La précision du sujet, du style et de la composition influence fortement le résultat.
Un token est une petite unité de texte traitée par un modèle de langage. Un mot peut correspondre à un seul token ou être découpé en plusieurs morceaux.
L’entraînement est la phase pendant laquelle un modèle ajuste ses paramètres en analysant de grandes quantités de données.
L’upscaling augmente la résolution d’une image ou d’une vidéo. Les outils IA peuvent aussi reconstruire certains détails pendant l’agrandissement.
La vidéo IA regroupe les techniques utilisant l’intelligence artificielle pour générer, transformer, animer, monter ou améliorer des séquences vidéo.
Un workflow IA est une suite organisée d’étapes et d’outils permettant de réaliser une tâche de manière répétable, manuelle ou automatisée.
Retrouvez sur mon site mes ressources, méthodes et contenus consacrés à la création IA : prompting, génération d’images, vidéo IA, storytelling, montage et monétisation de compétences créatives.
L’intelligence artificielle générative désigne les modèles capables de créer de nouveaux contenus à partir d’instructions ou de données de référence : texte, image, vidéo, musique, voix ou code.
L’intelligence artificielle est le domaine général. Le Machine Learning est une manière de construire des systèmes qui apprennent à partir de données. Le Deep Learning est une famille de techniques de Machine Learning utilisant des réseaux neuronaux profonds.
Commencez par le storyboard et le cadrage, puis apprenez le prompting visuel, le text-to-image, l’image-to-video, les mouvements de caméra, la cohérence des personnages et enfin le montage. Un bon workflow compte davantage que l’utilisation isolée d’un seul outil.
Non. Un bon prompt est surtout clair, structuré et adapté au modèle utilisé. Ajouter des détails contradictoires ou inutiles peut rendre le résultat moins cohérent.
Le text-to-video part principalement d’une description écrite. L’image-to-video utilise une image comme point de départ, ce qui offre généralement davantage de contrôle sur l’identité visuelle, la composition et le sujet.