Latence

Le délai entre ta demande et le début de la réponse. Le premier facteur de confort dans un produit qui parle à un modèle.

Les 124 termes IACONCEPT

/ EN CLAIR

La latence est le délai entre ta demande et le début de la réponse. Elle dépend du modèle, de la longueur du contexte envoyé, et du nombre d'étapes que ton système enchaîne avant de répondre.

C'est le premier facteur de confort dans un produit qui parle à un modèle. Au-delà de quelques secondes sans rien à l'écran, l'utilisateur croit que c'est cassé. D'où le streaming : on affiche la réponse au fil de sa production plutôt que d'attendre la fin.

Les gains se trouvent surtout en amont : réduire le contexte, supprimer une étape d'orchestration, appeler un modèle plus léger pour la partie simple.

/ COMMENT ÇA MARCHE

Ce que faitla latence, dans l'ordre.

  1. 01La requête partAvec tout le contexte à transmettre, et à lire.
  2. 02Le modèle démarrePlus le contexte est long, plus le premier token tarde.
  3. 03La réponse arriveEn streaming, mot à mot, ou d'un bloc à la fin.

Au-delà de quelques secondes sans rien à l'écran, l'utilisateur croit que c'est cassé. D'où le streaming.

124 TERMES IA · ↑ ↓ POUR PARCOURIR · ENTRÉE POUR OUVRIR