Thèmes
Colonne
Nos chroniqueurs experts proposent des opinions et des analyses sur des questions importantes auxquelles sont confrontés les entreprises et les managers modernes.
Plus dans cette série


Carolyn Geason-Beissel/MIT SMR | Getty Images
Les chefs d’entreprise repensent désormais les flux de travail, la conception organisationnelle et d’autres disciplines à mesure que leurs entreprises adoptent l’intelligence artificielle et les outils d’IA générative.
Dans mon travail À la MIT Sloan School of Management, j'ai enseigné les bases du fonctionnement des grands modèles linguistiques (LLM) à de nombreux cadres au cours des deux dernières années.
Certaines personnes postulent que les chefs d’entreprise ne veulent ni n’ont besoin de savoir comment fonctionnent les LLM et les outils d’IA générative qu’ils alimentent – et ne s’intéressent qu’au résultats les outils peuvent fournir.
Dans cette chronique, je partage des questions sur 10 sujets souvent mal compris sur lesquels on me pose souvent des questions, ainsi que leurs réponses.
10 questions et réponses essentielles sur GenAI et les LLM
1. Je comprends que les LLM génèrent une sortie de texte à la fois.
En d’autres termes, quand le LLM décide-t-il de donner à l’utilisateur la réponse finale à une question ?
Lorsqu'un LLM répond à une question, il produit du texte petit morceau à la fois. jeton.1 Les jetons peuvent être des mots ou des parties de mots. et ce qu'il a déjà écrit jusqu'à présent.2
Un système externe exécute le LLM dans une boucle « générer le jeton suivant ; l'ajouter à l'entrée ; générer le jeton suivant » jusqu'à ce qu'un condition d'arrêt est déclenché.
De nombreuses conditions d’arrêt sont utilisées en pratique. séquence d'arrêt.
Lorsque nous utilisons la version Web d'un outil comme ChatGPT en tant que consommateurs, nous ne voyons pas ce processus, seulement le texte final.
Le point important ici est que la « décision » d’arrêter est une interaction entre les prédictions symboliques du LLM et la logique de contrôle externe, et non une décision prise par le LLM.
2. Si le LLM fait une erreur et que je la corrige, sera-t-il mis à jour immédiatement ?
Non, le LLM ne se mettra pas à jour immédiatement si vous le corrigez.
Certaines applications, telles que ChatGPT, disposent d'une fonction de mémoire qui peut se mettre à jour en temps réel pour mémoriser des informations personnelles telles que votre nom, vos préférences ou votre emplacement.
3. Si le LLM génère à plusieurs reprises un jeton à la fois en fonction de la conversation en cours, pourquoi l'ai-je vu utiliser les informations d'une conversation précédente (disons, d'il y a une semaine) dans la réponse ?
Les LLM génèrent des réponses un jeton à la fois, en fonction des informations qui leur sont fournies dans cette conversation.
Lorsque vous démarrez une nouvelle conversation, des éléments pertinents de cette mémoire stockée peuvent être automatiquement ajouté à l'invite dans les coulisses.
Les détails de ce qui est stocké et du moment où il est utilisé varient selon le fournisseur, et les méthodes exactes n'ont pas été divulguées.
RAG, si vous n'êtes pas familier, est une technique utilisée pour fournir au LLM l'accès à un ensemble spécifique de données propriétaires.
4. Je comprends que les LLM ont une date limite de formation et qu'ils ne « savent » pas ce qui s'est passé après cette date. peut répondre aux questions sur les événements qui se sont produits après la date limite.
Lorsque vous posez une question sur quelque chose qui s'est produit après la date limite de formation d'un LLM, le modèle lui-même ne « connaît » pas l'événement à moins qu'il n'ait accès à des informations à jour.
Sans accès aux données en direct, un modèle peut toujours générer une réponse basée sur ses données d'entraînement qui ne reflète pas les mises à jour du monde réel.
Dans ces cas, le LLM peut générer une requête de recherche basée sur votre question, et une partie distincte du système (en dehors du modèle lui-même) effectue la recherche.
5. Si j'inclus des documents dans le cadre d'une invite, puis-je m'assurer que le LLM utilise uniquement les documents fournis lorsqu'il génère la réponse ?
Non. Bien que des invites minutieuses et des techniques telles que RAG puissent encourager un modèle d'IA à donner la priorité à un ensemble de documents fournis, les LLM standard ne peuvent pas être forcés à utiliser uniquement ce contenu.
6. Les LLM citent parfois les sources qui ont été utilisées pour générer la réponse à une question.
Les LLM peuvent fabriquer (halluciner) des citations ou utiliser des sources réelles de manière inexacte ou trompeuse.
7. Lorsque nous avons de nombreux documents, nous utilisons RAG, où nous collectons d'abord les informations pertinentes à partir des documents et incluons uniquement celles-ci dans l'invite. tous les documents.
Les LLM modernes comme GPT-4.1 et Gemini 2.5 offrent des fenêtres contextuelles contenant des millions de jetons, suffisamment pour contenir des livres entiers.
Bien que ces fenêtres contextuelles étendues soient puissantes, inclure tous les documents dans l’invite n’est pas toujours une bonne idée.
Premièrement, RAG ne consiste pas seulement à garder une invite courte. Surcharger le contexte avec trop d'informations ou des informations non pertinentes peut nuire aux performances, et garder le contexte et l'invite pertinents, concis et précis conduit souvent à de meilleures réponses.
Deuxièmement, même si les LLM peuvent accepter des contextes longs, ils ne traitent pas toutes les parties de la même manière.
Enfin, des invites plus longues signifient plus de jetons, ce qui augmente les coûts des API et ralentit les réponses.
En bref, les longues fenêtres contextuelles sont utiles, mais elles ne rendent pas la récupération obsolète. évalué en fonction des besoins de votre application spécifique.
8. Les hallucinations LLM peuvent-elles être éliminées ?
Non, les hallucinations ne peuvent pas être complètement éliminées avec la technologie LLM actuelle.
Cependant, une ingénierie minutieuse des invites et des stratégies telles que RAG, un réglage fin des données spécifiques au domaine et un post-traitement avec des contrôles basés sur des règles ou une validation externe peuvent réduire les hallucinations dans des cas d'utilisation spécifiques.3 Bien que ces stratégies ne garantissent pas l’élimination des hallucinations, elles peuvent améliorer suffisamment la fiabilité d’un LLM pour de nombreuses applications pratiques.
9. Puisque les hallucinations et les erreurs du LLM ne peuvent pas être éliminées, nous devons vérifier les réponses.
La vérification efficace des résultats du LLM dépend du type de tâche et du niveau de risque acceptable.
Pour les tâches ouvertes telles que les résumés, les essais, les rapports ou les analyses, l’examen humain offre la surveillance la plus fiable.
Une alternative de plus en plus populaire consiste à utiliser un « juge IA », qui est généralement un autre LLM capable d’évaluer ou de vérifier les résultats du premier outil.
Un « juge IA » est généralement un autre LLM utilisé pour évaluer ou vérifier les résultats du premier outil.
Les tâches structurées, telles que la génération de code, la classification d'informations ou la production de données structurées dans des formats tels que SQL ou JSON, se prêtent plus facilement à l'automatisation.
En résumé, les stratégies de contrôle les plus efficaces combinent automatisation et surveillance humaine.
10. Nous construisons un chatbot basé sur LLM et souhaitons garantir que sa réponse à une question reste inchangée lorsque différents utilisateurs posent la même question (ou qu'un utilisateur pose la même question à des moments différents).
Si par « garantie » vous entendez exactement toujours la même formulation, la réponse courte est non.
Si la même question est posée à différentes occasions en utilisant des mots différents, les réponses du LLM changeront très probablement. exactement la même réponse sera générée à chaque fois.
Vous pouvez réduire la variabilité en configurant certains paramètres LLM (par exemple, en réglant la « température » à zéro), en verrouillant la version exacte du modèle et même en auto-hébergant afin de contrôler l'ensemble de la pile matérielle et logicielle.4 Ainsi, vous verrez encore occasionnellement de petits changements de formulation ou d’accentuation qui ne changent pas le sens de la réponse sous-jacente.
La seule façon de garantir véritablement une formulation identique est de stocker (mettre en cache) la réponse la première fois qu'elle est générée et de servir ce texte stocké chaque fois que la même question est détectée.
En bref : vous pouvez donner des réponses extrêmement cohérentes, mais une garantie de formulation à 100 % n'est pas réalisable avec la technologie actuelle.
Références
1. En moyenne, un jeton représente environ les trois quarts d'un mot, et les LLM modernes ont un vocabulaire allant de dizaines de milliers à plus de 100 000 jetons. L'outil Tokenizer d'OpenAI et voyez comment un mot est symbolisé pour acquérir une compréhension plus profonde.
2. À proprement parler, étant donné une entrée, le LLM génère une probabilité (c'est-à-dire un nombre compris entre 0,0 et 1,0) pour chaque jeton de son vocabulaire.
3. Pour une étude récente des recherches universitaires sur ce sujet, voir Y. Wang, M. Wang, M.A. Manzoor et al., «Actualité des grands modèles de langage : une enquête», dans « Actes de la conférence 2024 sur les méthodes empiriques dans le traitement du langage naturel » (Miami : Association for Computational Linguistics, 12-16 novembre 2024), 19519-19529.
4. Pour n'en nommer que quelques-uns : opérations GPU non déterministes, différences d'arrondi en virgule flottante et mises à jour silencieuses du back-end.
#LLM #Travail #Top #ExecutiveLevel #Questions

