Themen
Säule
Unsere Fachkolumnisten bieten Meinungen und Analysen zu wichtigen Themen, mit denen moderne Unternehmen und Manager konfrontiert sind.
Mehr in dieser Serie


Carolyn Geason-Beissel/MIT SMR | Getty Images
Unternehmensführer überdenken jetzt Arbeitsabläufe, Organisationsdesign und andere Disziplinen, da ihre Unternehmen künstliche Intelligenz und generative KI-Tools nutzen.
In meiner Arbeit An der MIT Sloan School of Management habe ich in den letzten zwei Jahren vielen Führungskräften die Grundlagen der Funktionsweise großer Sprachmodelle (LLMs) beigebracht.
Manche vertreten die Ansicht, dass Unternehmensleiter weder wissen wollen noch müssen, wie LLMs und die von ihnen unterstützten generativen KI-Tools funktionieren – und nur daran interessiert sind Ergebnisse die Werkzeuge können liefern.
In dieser Kolumne teile ich Fragen zu 10 oft missverstandenen Themen, zu denen ich oft gefragt werde, zusammen mit den Antworten darauf.
10 wesentliche Fragen und Antworten zu GenAI und LLMs
1. Ich verstehe, dass LLMs jeweils einen Text nach dem anderen ausgeben.
Anders ausgedrückt: Wann entscheidet das LLM, dem Benutzer die endgültige Antwort auf eine Frage zu geben?
Wenn ein LLM eine Frage beantwortet, erzeugt es einen Text nach dem anderen. Token.1 Token können Wörter oder Wortteile sein. und was es bisher schon geschrieben hat.2
Ein externes System führt das LLM in einer „Nächsten Token generieren; an die Eingabe anhängen; nächsten Token generieren“-Schleife aus, bis a Stoppbedingung ausgelöst wird.
In der Praxis werden viele Stoppbedingungen verwendet. Stoppsequenz.
Wenn wir als Verbraucher die Webversion eines Tools wie ChatGPT verwenden, sehen wir diesen Vorgang nicht, sondern nur den fertigen Text.
Der wichtige Punkt hierbei ist, dass die „Entscheidung“ zum Stoppen eine Interaktion zwischen den Token-Vorhersagen des LLM und der externen Kontrolllogik ist und keine Entscheidung des LLM.
2. Wenn das LLM einen Fehler macht und ich ihn korrigiere, aktualisiert es sich dann sofort selbst?
Nein, das LLM aktualisiert sich nicht sofort, wenn Sie es korrigieren.
Einige Apps wie ChatGPT verfügen über eine Speicherfunktion, die in Echtzeit aktualisiert werden kann, um persönliche Informationen wie Ihren Namen, Ihre Vorlieben oder Ihren Standort zu speichern.
3. Wenn das LLM immer wieder ein Token nach dem anderen generiert, basierend auf der aktuellen Konversation, warum habe ich dann gesehen, dass es in der Antwort Informationen aus einer früheren Konversation (z. B. von vor einer Woche) verwendet?
LLMs generieren jeweils Token für Antworten, basierend auf den Eingaben, die sie in dieser Konversation erhalten.
Wenn Sie einen neuen Chat starten, werden möglicherweise relevante Teile dieser gespeicherten Erinnerung angezeigt automatisch zur Eingabeaufforderung hinzugefügt hinter den Kulissen.
Die Einzelheiten darüber, was gespeichert wird und wann es verwendet wird, variieren je nach Anbieter und die genauen Methoden wurden nicht bekannt gegeben.
Falls Sie sich nicht auskennen, handelt es sich bei RAG um eine Technik, die verwendet wird, um dem LLM Zugriff auf einen bestimmten Satz proprietärer Daten zu ermöglichen.
4. Ich verstehe, dass LLMs einen Stichtag für die Ausbildung haben und sie nicht „wissen“, was nach diesem Datum passiert ist. dürfen Beantworten Sie Fragen zu Ereignissen, die stattgefunden haben nach das Stichdatum.
Wenn Sie eine Frage zu etwas stellen, das nach dem Stichtag der LLM-Schulung passiert ist, „weiß“ das Modell selbst nichts von dem Ereignis, es sei denn, es hat Zugriff auf aktuelle Informationen.
Ohne Zugriff auf Live-Daten generiert ein Modell möglicherweise immer noch eine Antwort auf der Grundlage seiner Trainingsdaten, die nicht die Aktualisierungen aus der realen Welt widerspiegelt.
In diesen Fällen generiert das LLM möglicherweise eine Suchabfrage basierend auf Ihrer Frage und ein separater Teil des Systems (außerhalb des Modells selbst) führt die Suche durch.
5. Wenn ich Dokumente als Teil einer Eingabeaufforderung einbinde, kann ich dann sicherstellen, dass das LLM beim Generieren der Antwort nur die bereitgestellten Dokumente verwendet?
Nein. Während sorgfältige Eingabeaufforderungen und Techniken wie RAG ein KI-Modell dazu ermutigen können, eine Reihe bereitgestellter Dokumente zu priorisieren, können Standard-LLMs nicht gezwungen werden, nur diese Inhalte zu verwenden.
6. LLMs zitieren manchmal die Quellen, die zur Generierung der Antwort auf eine Frage verwendet wurden.
Nein. LLMs können Zitate fabrizieren (halluzinieren) oder echte Quellen auf ungenaue oder irreführende Weise verwenden.
7. Wenn wir viele Dokumente haben, verwenden wir RAG, wobei wir zunächst relevante Informationen aus Dokumenten sammeln und nur diese in die Eingabeaufforderung aufnehmen. alle die Dokumente.
Moderne LLMs wie GPT-4.1 und Gemini 2.5 bieten Kontextfenster mit Millionen Token – genug, um ganze Bücher aufzunehmen.
Obwohl diese erweiterten Kontextfenster leistungsstark sind, ist es nicht immer eine gute Idee, alle Dokumente in die Eingabeaufforderung einzubeziehen.
Erstens geht es bei RAG nicht nur darum, die Eingabeaufforderung kurz zu halten. Den Kontext überladen Zu viele oder irrelevante Informationen können die Leistung beeinträchtigen, und wenn der Kontext und die Eingabeaufforderung relevant, prägnant und genau gehalten werden, führt dies oft zu besseren Antworten.
Zweitens verarbeiten LLMs zwar lange Kontexte, verarbeiten aber nicht alle Teile gleich gut.
Schließlich bedeuten längere Eingabeaufforderungen mehr Token, was die API-Kosten erhöht und die Antworten verlangsamt.
Kurz gesagt, lange Kontextfenster sind nützlich, machen das Abrufen jedoch nicht überflüssig. ausgewertet basierend auf den Anforderungen Ihrer spezifischen Anwendung.
8. Können LLM-Halluzinationen beseitigt werden?
Nein, Halluzinationen können mit der aktuellen LLM-Technologie nicht vollständig beseitigt werden.
Sorgfältiges Prompt-Engineering und Strategien wie RAG, Feinabstimmung domänenspezifischer Daten und Nachbearbeitung mit regelbasierten Prüfungen oder externer Validierung können jedoch möglich sein Halluzinationen reduzieren in bestimmten Anwendungsfällen.3 Diese Strategien garantieren zwar nicht die Eliminierung von Halluzinationen, können aber die Zuverlässigkeit eines LLM für viele praktische Anwendungen ausreichend verbessern.
9. Da LLM-Halluzinationen und -Fehler nicht beseitigt werden können, müssen wir die Antworten überprüfen.
Die effiziente Überprüfung der LLM-Ergebnisse hängt von der Art der Aufgabe und dem akzeptablen Risikoniveau ab.
Bei offenen Aufgaben wie Zusammenfassungen, Aufsätzen, Berichten oder Analysen bietet die menschliche Überprüfung die zuverlässigste Aufsicht.
Eine immer beliebter werdende Alternative ist die Verwendung eines „KI-Richters“, bei dem es sich typischerweise um einen weiteren LLM handelt, der die Ergebnisse des ersten Tools bewerten oder verifizieren kann.
Ein „KI-Richter“ ist typischerweise ein weiterer LLM, der zur Bewertung oder Verifizierung der Ergebnisse des ersten Tools verwendet wird.
Strukturierte Aufgaben wie das Generieren von Code, das Klassifizieren von Informationen oder das Erstellen strukturierter Daten in Formaten wie SQL oder JSON eignen sich leichter für die Automatisierung.
Zusammenfassend lässt sich sagen, dass die effizientesten Prüfstrategien Automatisierung und menschliche Aufsicht kombinieren.
10. Wir bauen einen LLM-basierten Chatbot und möchten garantieren, dass seine Antwort auf eine Frage unverändert bleibt, wenn verschiedene Benutzer dieselbe Frage stellen (oder ein Benutzer dieselbe Frage zu unterschiedlichen Zeiten stellt).
Wenn Sie mit „Garantie“ meinen genau immer derselbe Wortlaut, die kurze Antwort lautet nein.
Wenn dieselbe Frage bei verschiedenen Gelegenheiten mit unterschiedlichen Worten gestellt wird, werden sich die Antworten des LLM höchstwahrscheinlich ändern. genau Es wird jedes Mal die gleiche Antwort generiert.
Sie können die Variabilität reduzieren, indem Sie bestimmte LLM-Einstellungen konfigurieren (z. B. „Temperatur“ auf Null setzen), die genaue Modellversion sperren und sogar selbst hosten, sodass Sie den gesamten Hardware- und Software-Stack kontrollieren.4 Daher werden Sie immer noch gelegentlich kleine Formulierungs- oder Betonungsverschiebungen bemerken, die die Bedeutung der zugrunde liegenden Antwort nicht ändern.
Die einzige Möglichkeit, wirklich identische Formulierungen zu gewährleisten, besteht darin, die Antwort bei der ersten Generierung zu speichern (cache) und diesen gespeicherten Text immer dann bereitzustellen, wenn dieselbe Frage erkannt wird.
Kurz gesagt: Sie können Antworten äußerst konsistent gestalten, eine 100-prozentige Formulierungsgarantie ist mit der aktuellen Technologie jedoch nicht erreichbar.
Referenzen
1. Im Durchschnitt besteht ein Token aus etwa drei Vierteln eines Wortes, und moderne LLMs verfügen über einen Wortschatz von Zehntausenden bis über 100.000 Token. Das Tokenizer-Tool von OpenAI und sehen Sie, wie ein Wort tokenisiert wird, um ein tieferes Verständnis zu erlangen.
2. Streng genommen generiert das LLM bei gegebener Eingabe eine Wahrscheinlichkeit (d. h. eine Zahl zwischen 0,0 und 1,0) für jedes Token in seinem Vokabular.
3. Für einen aktuellen Überblick über die akademische Forschung zu diesem Thema siehe Y. Wang, M. Wang, M.A. Manzoor et al., „Faktizität großer Sprachmodelle: Eine Umfrage, in „Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing“ (Miami: Association for Computational Linguistics, 12.–16. November 2024), 19519–19529.
4. Um nur einige zu nennen: nichtdeterministische GPU-Operationen, Gleitkomma-Rundungsdifferenzen und stille Back-End-Updates.
#LLMs #Arbeit #Top #ExecutiveLevel #Fragen

