Multimodal

Un modèle qui lit et produit autre chose que du texte : image, son, vidéo, code.

Les 124 termes IACONCEPT

/ EN CLAIR

Un modèle multimodal lit ou produit autre chose que du texte : une image, un son, une vidéo, un document scanné. La même requête peut contenir une capture d'écran et une question sur cette capture.

Ce que ça change concrètement : on cesse de décrire ce qu'on a sous les yeux. Une facture photographiée, une maquette, un graphique, un extrait de code en image se passent directement au modèle, qui en extrait ce qu'il faut.

La précision n'est pas égale partout. Lire un texte net dans une image est fiable ; mesurer une distance, lire un tableau dense ou distinguer deux nuances proches l'est beaucoup moins.

/ COMMENT ÇA MARCHE

Ce que faitun modèle multimodal, dans l'ordre.

  1. 01Tu joins autre chose que du texteUne capture, une facture photographiée, un schéma, un son.
  2. 02Le modèle l'interprèteIl lit le contenu du fichier comme il lirait une phrase.
  3. 03Il répond dessusExtraction, résumé, correction : sans que tu aies eu à décrire.

Lire un texte net est fiable. Mesurer, lire un tableau dense ou distinguer deux nuances proches l'est beaucoup moins.

124 TERMES IA · ↑ ↓ POUR PARCOURIR · ENTRÉE POUR OUVRIR