Inférence

Le moment où le modèle calcule sa réponse. C'est ce qui consomme le temps et l'argent, l'entraînement étant déjà passé.

Les 124 termes IACONCEPT

/ EN CLAIR

L'inférence est le moment où le modèle calcule sa réponse. L'entraînement est déjà passé et ne se reproduit pas : ce que tu paies et ce que tu attends, c'est l'inférence, à chaque appel.

Elle explique la structure des prix et des limites. Un modèle plus grand infère plus lentement et coûte plus cher par token, et c'est pourquoi on ne met pas le plus gros modèle partout mais le plus petit qui fasse le travail.

C'est aussi le levier d'optimisation le plus simple : moins de contexte envoyé, moins de tokens produits, un modèle plus léger sur les étapes simples. Trois réglages, et la facture change d'ordre de grandeur.

/ COMMENT ÇA MARCHE

Ce que faitune inférence, dans l'ordre.

  1. 01Ta requête arriveAvec tout le contexte : c'est ce qui va être lu.
  2. 02Le modèle calculeToken après token, sur la machine du fournisseur.
  3. 03La réponse revientEt c'est ce calcul-là que tu paies, à chaque appel.

L'entraînement est déjà passé. Ce qui coûte au quotidien, c'est l'inférence, et elle se règle par le contexte.

124 TERMES IA · ↑ ↓ POUR PARCOURIR · ENTRÉE POUR OUVRIR