{"id":15905,"date":"2026-10-04T10:19:00","date_gmt":"2026-10-04T09:19:00","guid":{"rendered":"https:\/\/www.keris-studio.fr\/blog\/?p=15905"},"modified":"2026-10-04T10:20:13","modified_gmt":"2026-10-04T09:20:13","slug":"ai-bases-techniques","status":"publish","type":"post","link":"https:\/\/www.keris-studio.fr\/blog\/?p=15905","title":{"rendered":"AI-Bases techniques"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Comprendre le fonctionnement des IA g\u00e9n\u00e9rative permet d&rsquo;\u00e9viter de se retrouver pi\u00e9g\u00e9 dans les discours approximatifs et souvent \u00e9rron\u00e9s \u00e0 propos de ce que font ou pas les mod\u00e8les, sur la fa\u00e7on dont ils ont \u00e9t\u00e9 entrain\u00e9s et dont ils fonctionnent.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voici les notions cl\u00e9s pour la cr\u00e9ation de texte (LLM) et pour la cr\u00e9ation d&rsquo;images (diffusion).<\/p>\n\n\n\n<!--more-->\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Comment fonctionne un LLM ? Une explication en 12 \u00e9tapes<\/strong><\/h2>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n<iframe loading=\"lazy\" title=\"Comment fonctionne un LLM ?\" width=\"474\" height=\"267\" src=\"https:\/\/www.youtube.com\/embed\/5YpM3WQhcHE?feature=oembed\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen><\/iframe>\n<\/div><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Les grands mod\u00e8les de langage (LLM) comme ChatGPT ou Claude semblent comprendre et r\u00e9diger du texte. Pourtant, ils ne font qu&rsquo;une seule chose : pr\u00e9dire le mot suivant.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Cette animation de 2 minutes 30 suit une phrase simple, \u00ab Le chat boit du\u2026 \u00bb, et montre comment un LLM la compl\u00e8te. Elle se d\u00e9roule en deux parties.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>A \u00b7 L&rsquo;entra\u00eenement.<\/strong> Le mod\u00e8le apprend la langue \u00e0 partir de milliers de milliards de mots. Il devine le mot suivant, se trompe, et ses param\u00e8tres sont corrig\u00e9s, des milliards de fois. Des humains l&rsquo;aident ensuite \u00e0 formuler des r\u00e9ponses utiles (fine-tuning et RLHF).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>B \u00b7 La g\u00e9n\u00e9ration.<\/strong> Le texte est d\u00e9coup\u00e9 en tokens, puis transform\u00e9 en vecteurs qui encodent le sens et la position de chaque mot. Gr\u00e2ce au m\u00e9canisme d&rsquo;attention, chaque mot tient compte des pr\u00e9c\u00e9dents. Le mod\u00e8le attribue ensuite une probabilit\u00e9 \u00e0 chaque suite possible, en choisit une, et recommence jusqu&rsquo;\u00e0 la fin de la r\u00e9ponse.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Une derni\u00e8re sc\u00e8ne montre le r\u00f4le du contexte. Seule, la phrase \u00ab Le chat boit\u2026 \u00bb appelle \u00ab du lait \u00bb. Mais si l&rsquo;on pr\u00e9cise qu&rsquo;on vient de remplir un bol d&rsquo;eau au robinet pour le chat, le mod\u00e8le r\u00e9pond \u00ab de l&rsquo;eau \u00bb.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Comment l&rsquo;IA cr\u00e9e-t-elle des images ?<\/strong><\/h2>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n<iframe loading=\"lazy\" title=\"Comment l&amp;apos;IA cr\u00e9e-t-elle des images ?\" width=\"474\" height=\"267\" src=\"https:\/\/www.youtube.com\/embed\/kphAVfDPQjc?feature=oembed\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen><\/iframe>\n<\/div><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Les g\u00e9n\u00e9rateurs d&rsquo;images comme Midjourney, DALL\u00b7E ou Stable Diffusion reposent sur une m\u00e9thode appel\u00e9e <em>diffusion<\/em>. Le principe est simple : on apprend \u00e0 un r\u00e9seau de neurones \u00e0 retirer du bruit d&rsquo;une image.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le processus se d\u00e9roule en deux \u00e9tapes. Pendant l&rsquo;<strong>entra\u00eenement<\/strong>, le mod\u00e8le observe des milliards d&rsquo;images accompagn\u00e9es de leur l\u00e9gende. Il apprend ainsi le lien entre les mots et ce qu&rsquo;ils repr\u00e9sentent visuellement. Pendant la <strong>g\u00e9n\u00e9ration<\/strong>, il part d&rsquo;une image de bruit al\u00e9atoire et la nettoie pas \u00e0 pas, guid\u00e9 par le texte saisi, jusqu&rsquo;\u00e0 obtenir une image.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le mod\u00e8le ne stocke pas les images qu&rsquo;il a vues : il en retient des id\u00e9es g\u00e9n\u00e9rales, comme la forme d&rsquo;un soleil, d&rsquo;une montagne ou un style d&rsquo;affiche. Chaque image produite est donc une composition nouvelle, et non un collage d&rsquo;\u0153uvres existantes.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><strong>Prompt embedding: how a sentence steers an image model<\/strong><\/h2>\n\n\n\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n<iframe loading=\"lazy\" title=\"Prompt Embedding : how a sentence steers an image model\" width=\"474\" height=\"267\" src=\"https:\/\/www.youtube.com\/embed\/tnY9stlG9mk?feature=oembed\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen><\/iframe>\n<\/div><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">A diffusion model can&rsquo;t read words. When you type a prompt such as <em>\u00ab\u00a0Une villa de style Bauhaus au bord de mer\u00a0\u00bb<\/em>, a tokenizer first cuts it into tokens: words or pieces of words, each with an ID. A text encoder (CLIP or T5) then turns each token into an embedding, a list of hundreds of numbers. Because tokens read each other along the way, \u00ab\u00a0bord\u00a0\u00bb next to \u00ab\u00a0mer\u00a0\u00bb comes to mean the seashore.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">These embeddings sit in a meaning space where similar ideas are close together: villa near maison, Bauhaus near Gropius and toit plat. The image model never sees the words, only this geometry.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Generation starts from pure noise. At each step, a denoiser removes a little noise. Through cross-attention, every region of the image checks which tokens matter to it: \u00ab\u00a0villa\u00a0\u00bb shapes the building and \u00ab\u00a0mer\u00a0\u00bb the water. Classifier-free guidance (CFG) strengthens the prompt&rsquo;s effect by comparing a prediction made with the prompt to one made without it. A negative prompt takes the empty prompt&rsquo;s place, so guidance pushes the image away from what you don&rsquo;t want.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Comprendre le fonctionnement des IA g\u00e9n\u00e9rative permet d&rsquo;\u00e9viter de se retrouver pi\u00e9g\u00e9 dans les discours approximatifs et souvent \u00e9rron\u00e9s \u00e0 propos de ce que font ou pas les mod\u00e8les, sur la fa\u00e7on dont ils ont \u00e9t\u00e9 entrain\u00e9s et dont ils fonctionnent. Voici les notions cl\u00e9s pour la cr\u00e9ation de texte (LLM) et pour la cr\u00e9ation &hellip; <a href=\"https:\/\/www.keris-studio.fr\/blog\/?p=15905\" class=\"more-link\">Continuer la lecture de <span class=\"screen-reader-text\">AI-Bases techniques<\/span>  <span class=\"meta-nav\">&rarr;<\/span><\/a><\/p>\n","protected":false},"author":2,"featured_media":15906,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[593],"tags":[546,652],"class_list":["post-15905","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-artificial","tag-artificial-intelligence","tag-llm"],"_links":{"self":[{"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/posts\/15905","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=15905"}],"version-history":[{"count":2,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/posts\/15905\/revisions"}],"predecessor-version":[{"id":15908,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/posts\/15905\/revisions\/15908"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=\/wp\/v2\/media\/15906"}],"wp:attachment":[{"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=15905"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=15905"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.keris-studio.fr\/blog\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=15905"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}