主题
专栏
我们的专家专栏作家就现代企业和管理者面临的重要问题提供意见和分析。
本系列中的更多内容


Carolyn Geason-Beissel/MIT SMR | Getty Images
随着公司采用人工智能和生成式人工智能工具,企业领导者现在正在重新思考工作流程、组织设计和其他学科。
在我的工作中 在麻省理工学院斯隆管理学院,过去两年里,我向许多高管教授了大型语言模型 (LLM) 如何工作的基础知识。
有些人认为,企业领导者既不想也不需要知道法学硕士及其支持的生成式人工智能工具如何工作,而只对 结果 这些工具可以实现。
在本专栏中,我分享了有关我经常被问及的 10 个经常被误解的主题的问题及其答案。
关于 GenAI 和法学硕士的 10 个基本问题和解答
1. 据我所知,法学硕士一次生成一段文本的输出。
换句话说,法学硕士何时决定向用户提供问题的最终答案?
当法学硕士回答问题时,它会一次生成一小段文本。 代币.1 标记可以是单词或单词的一部分。 和 到目前为止它已经写了什么。2
外部系统在“生成下一个令牌;将其附加到输入;生成下一个令牌”循环中运行 LLM,直到 停止条件 被触发。
实际中使用了许多停止条件。 停止顺序.
当我们作为消费者使用 ChatGPT 等网络版工具时,我们看不到这个过程——只能看到最终的文本。
这里重要的一点是,停止的“决定”是LLM的代币预测和外部控制逻辑之间的相互作用,而不是LLM做出的决定。
2. 如果LLM犯了错误,我改正了,它会立即自行更新吗?
不,如果您更正,LLM 不会立即自行更新。
某些应用程序(例如 ChatGPT)具有记忆功能,可以实时更新以记住您的姓名、偏好或位置等个人信息。
3. 如果 LLM 根据当前对话一次重复生成一个令牌,为什么我看到它在响应中使用先前对话(例如一周前)中的信息?
LLM 根据他们在对话中给出的输入,一次生成一个令牌的响应。
当您开始新的聊天时,该存储内存的相关部分可能会被 自动地 添加到提示中 幕后。
存储内容和使用时间的详细信息因供应商而异,具体方法尚未披露。
如果您不熟悉的话,RAG 是一种用于为法学硕士提供对一组特定专有数据的访问的技术。
4. 我知道法学硕士有一个培训截止日期,他们不“知道”该日期之后发生的事情。 能 回答有关所发生事件的问题 后 截止日期。
当您询问法学硕士培训截止日期之后发生的事情时,模型本身并不“知道”该事件,除非它能够访问最新信息。
如果无法访问实时数据,模型仍可能根据其训练数据生成不反映现实世界更新的答案。
在这些情况下,法学硕士可能会根据您的问题生成搜索查询,并且系统的单独部分(模型本身之外)执行搜索。
5. 如果我将文档作为提示的一部分,我能否确保 LLM 在生成响应时仅使用所提供的文档?
不会。虽然仔细的提示和 RAG 等技术可以鼓励人工智能模型对一组提供的文档进行优先级排序,但不能强迫标准法学硕士仅使用该内容。
6. 法学硕士有时会引用用于生成问题答案的来源。
不会。法学硕士可以捏造(幻觉)引文或以不准确或误导性的方式使用真实来源。
7. 当我们有很多文档时,我们使用 RAG,我们首先从文档中收集相关信息,并仅包含提示中的信息。 全部 文件。
像 GPT-4.1 和 Gemini 2.5 这样的现代法学硕士提供了百万个令牌上下文窗口——足以容纳整本书。
虽然这些扩展上下文窗口功能强大,但在提示中包含所有文档并不总是一个好主意。
首先,RAG 不仅仅是让提示简短。 重载上下文 太多或不相关的信息可能会损害性能,而保持上下文和提示的相关性、简洁性和准确性通常会带来更好的答案。
其次,尽管法学硕士可以接受长上下文,但他们不能同样很好地处理所有部分。
最后,较长的提示意味着更多的令牌,这会增加 API 成本并减慢响应速度。
简而言之,长上下文窗口很有用,但它们并不会使检索变得过时。 评价的 根据您的具体应用的需求。
8. LLM幻觉可以消除吗?
不,目前的法学硕士技术无法完全消除幻觉。
然而,仔细的提示工程和策略(例如 RAG、针对特定领域的数据进行微调以及使用基于规则的检查或外部验证进行后处理)可以 减少幻觉 在特定的用例中。3 虽然这些策略并不能保证消除幻觉,但它们可以提高法学硕士的可靠性,足以满足许多实际应用的需要。
9. 由于LLM的幻觉和错误无法消除,所以我们需要检查答案。
有效检查法学硕士输出取决于任务类型和可接受的风险级别。
对于摘要、论文、报告或分析等开放式任务,人工审核提供最可靠的监督。
一种越来越流行的替代方案是使用“人工智能法官”,这通常是另一个可以评估或验证第一个工具的输出的法学硕士。
“人工智能法官”通常是另一个法学硕士,用于评估或验证第一个工具的输出。
结构化任务(例如生成代码、对信息进行分类或以 SQL 或 JSON 等格式生成结构化数据)更容易实现自动化。
总之,最有效的检查策略结合了自动化和人工监督。
10. 我们正在构建一个基于 LLM 的聊天机器人,并希望保证当不同用户问同一问题(或一个用户在不同时间问同一问题)时,其对问题的答案保持不变。
如果“保证”是指 确切地 每次都是同样的措辞,简短的答案是否定的。
如果同一个问题在不同场合使用不同的词语提出,LLM的答案很可能会改变。 确切地 每次都会生成相同的答案。
您可以通过配置某些 LLM 设置(例如,将“温度”设置为零)、锁定确切的模型版本,甚至自托管来减少可变性,以便您控制整个硬件和软件堆栈。4 因此,您仍然偶尔会看到一些小的措辞或重点的变化,这些变化不会改变潜在答案的含义。
真正保证相同措辞的唯一方法是在第一次生成答案时存储(缓存)答案,并在检测到相同问题时提供存储的文本。
简而言之:您可以使答案极其一致,但以当前技术无法实现 100% 的措辞保证。
参考资料
1. 平均而言,一个 token 大约是一个单词的四分之三,而现代法学硕士拥有数万到超过 100,000 个 token 的词汇量。 OpenAI 的 Tokenizer 工具 并了解如何对单词进行标记以获得更深入的理解。
2. 严格来说,给定一个输入,LLM 会为其词汇表中的每个标记生成一个概率(即 0.0 到 1.0 之间的数字)。
3. 有关该主题的最新学术研究调查,请参阅 Y. Wang、M. Wang、M.A. Manzoor 等人,“大型语言模型的真实性:调查,”《2024 年自然语言处理经验方法会议论文集》(迈阿密:计算语言学协会,2024 年 11 月 12-16 日),19519-19529。
4. 仅举几例:不确定性 GPU 操作、浮点舍入差异和静默后端更新。
#LLMs #Work #Top #ExecutiveLevel #Questions

