← 返回博客

人工智能 / 机器学习 / 生成人工智能 / AI素养

人工智能究竟是什么?它如何学习、生成并犯错

PetexSpace

在吃完早餐之前,你可能已经使用过人工智能好几次了。电子邮件服务将可疑消息移出了视线。地图比较了可能的路线。手机摄像头发现了一张脸或一棵植物。音乐服务重新排列了列表。这些时刻看起来都不像科幻小说中的机器。它们看起来就像是代表您做出小判断的普通软件。

这就是人工智能感觉比其应有的更难理解的原因之一。该界面显示了答案,但隐藏了机制:某人选择的目标、用于构建模型的示例、作为输入提供的信号以及确定结果是否足够好的测试。生成式人工智能又增加了一层混乱,因为它可以用优美的语言解释自己,即使解释不完整或错误。

本指南打开了机器的大门,但没有假装每个人工智能系统都以相同的方式工作。它从头到尾都遵循一个实际问题:在机器将输入转换为输出之前必须发生什么,以及在信任结果之前应该检查什么?

人工智能的有用定义

OECD更新的定义 将人工智能系统描述为基于机器的系统,它从输入推断如何生成可以影响物理或虚拟环境的输出,例如预测、内容、建议或决策。不同的系统在自主性以及部署后是否继续适应方面有所不同。

重要的动词是infer。传统计算器遵循完全指定如何将数字转换为答案的规则。人工智能模型经常处理这样的情况:手工编写每条规则是不切实际的。它根据模式、约束或学习关系估计有用的输出。根据任务和条件的不同,输出可能是优秀的、平庸的,也可能是危险的误导。

因此,人工智能不是一种产品、一种算法或一种数字思维。它是一把覆盖许多系统的保护伞。垃圾邮件分类器、语音识别器、蛋白质结构预测器和语言模型都可以符合定义,但除了广泛的输入-模型-输出模式之外几乎没有什么共享。

每个人工智能系统不仅仅是一个模型

公众讨论常常将模型视为整个机器。实际上,模型是系统内的一个组件。有五个部分值得分开:

  • 目标:系统正在优化以预测、排名、生成或决定什么。
  • 输入:使用时可用的信息,例如像素、文字、传感器读数、位置或过去的行为。
  • 模型:将输入映射到结果的学习或工程机制。
  • 输出和界面:显示给某人或传递给另一个系统的标签、分数、路线、图像、句子或动作。
  • 评估和反馈:用于判断系统在真实条件下是否工作的测试、监控、纠正和人为决策。

考虑路线规划。目标可能是尽量减少预计的旅行时间。输入包括道路网络、当前位置、封闭情况和交通信号。模型估计可能路线的成本。该界面呈现一种或多种选择。当交通发生变化和旅程完成时,就会收到反馈。有用的结果来自整个链条,而不是来自孤立的算法。

其目的也值得仔细审视。一个系统可以优化其指定的目标,但仍然会产生人们不喜欢的结果。平均最快的路线可能包含压力较大的转弯。针对点击进行优化的推荐可能并不是让用户最了解情况的推荐。计算机不会自动发现正确的人类目标。人们定义目标,选择可以衡量的内容,并接受权衡。

机器如何从示例中学习

假设苹果经销商想要从相机图像中识别受伤的水果。基于规则的程序可能会使用工程师编写的阈值检查颜色和形状。这可以在受控的环境下发挥作用,但真正的苹果在品种、成熟度、光线、角度和表面纹理上都有所不同。机器学习方法使用许多示例并调整模型,使其预测与已知结果越来越匹配。

An apple-sorting example showing human-provided examples, model training, a test set, and classification of a new apple
A simplified learning pipeline: examples shape the model, a separate test set checks generalization, and inference handles a new case.

在训练期间,模型对示例进行预测,测量这些预测与期望结果的差距,并更新数值参数以减少误差。不同算法的细节有所不同,但循环是可识别的:预测、测量、调整、重复。该模型没有存储诸如每个黑斑都是瘀伤之类的口头规则。它正在拟合一种可以组合许多视觉信号的数学关系。

训练、验证、测试和推理

这些术语描述不同的时刻,不应合并为一个:

  • 训练数据用于调整模型的参数。
  • 验证数据有助于在开发仍在进行时选择设置并比较版本。
  • 测试数据被分开来估计所选模型如何处理它没有直接学习的示例。
  • 推理是经过训练的模型接收新输入并产生输出的时刻。

在熟悉的例子上表现出色但在新的例子上表现不佳的模型没有足够好地学习预期的模式。它的训练集中可能有过度拟合的偶然细节。谷歌的 机器学习速成班 将数据集、泛化、过度拟合、评估、生产系统和公平性视为实际机器学习的单独部分。训练分数本身并不能可靠地描述现实世界的行为。

即使是好的测试也可能过于狭窄。在一个摄像头和一个仓库灯下测试的苹果分类器在部署到另一个摄像头和一个仓库灯下后可能会失败。这就是分配转变:围绕新投入的条件不再类似于开发过程中所代表的条件。真实的系统需要监控,因为世界并不承诺保持像测试集一样。

神经网络和深度学习,没有神话

神经网络是由数值运算的连接层构建的模型。每层将一种表示转换为另一种表示。图像模型中的早期层可能响应简单的视觉结构;后面的层可以将这些信号组合成更特定于任务的模式。深度学习是指具有许多此类层的神经网络,经过训练可以从数据中学习有用的表示。

生物词汇是历史灵感,而不是模型像人脑一样思考的证据。网络可以包含数百万或数十亿个可调节参数,但仍然没有普通人类意义上的个人经验、意图或理解。它执行由其架构、训练目标、数据和当前输入决定的计算。

在原始输入复杂(包括图像、音频、语言和科学结构)的情况下,深度学习尤其有效。它的优势是有代价的:很难解释学习信号的哪种组合产生了特定的输出,并且性能可能取决于大型数据集、大量计算和仔细评估。

生成式人工智能改变了什么

分类器在定义的类别中进行选择。生成模型产生类似于其训练分布模式的新材料。根据模型的不同,该材料可以是文本、图像、音频、视频、代码或科学结构。一代让人工智能感觉更具创造力和对话性,但它并没有消除底层的统计机制。

大型语言模型(LLM)将文本作为标记进行处理。标记可以是单词、单词的一部分、标点符号或其他小单位。给定上下文中已有的标记,该模型会估计可能的下一个标记的分布,根据系统的解码设置选择一个标记,将其附加并重复。谷歌的 大语言模型简介 直接描述了这个序列预测。

A mechanical illustration dividing a sentence into tokens and selecting the next token from several probabilities
A language model builds a response token by token. The illustration simplifies a much larger numerical process, but the sequential prediction is real.

现代LLM普遍使用2017年论文中介绍的Transformer架构 您所需要的就是关注。它的注意力机制让模型能够权衡上下文中标记之间的关系,而不是将每个单词作为一个孤立的项目进行处理。跨大型文本集的训练使模型能够捕获语法、风格、重复出现的事实、推理模式以及参数中概念之间的关系。

这不会将模型转变为传统数据库。它的参数编码分布式统计关系,而不是一个总是可以准确引用的整洁的源文档库。提示中的文本和运行时提供的任何文档都会成为上下文,但上下文有限制。一些应用程序在模型周围添加搜索、工具、计算器或文档检索。这些添加可以改善基础,但最终答案可能仍将检索到的证据与生成的措辞和不受支持的推论结合起来。

最令人印象深刻的人工智能往往是高度专业化的

对话模型受到关注,因为任何人都可以在几秒钟内测试它们。但人工智能的价值并不仅限于对话。窄框架系统可以通过更清晰的输入、输出和评估标准来解决问题:

  • 光学字符识别器将文档图像中的像素映射为可编辑字符。
  • 欺诈模型对交易进行排名以供进一步审查,而不是宣布每个标记的案件为犯罪。
  • 天气模型根据观测和物理结构估计未来的大气状态。
  • 科学模型预测了研究人员可以与实验进行比较的分子特性或结构。

PetexSpace 的 图像转文本工具 说明了第一种聚焦任务。输入是图像,所需的输出是可编辑文本,并且可以直接对照源检查结果。模糊的照片、不寻常的布局、手写和不正确的语言设置仍然会降低准确性。这项任务之所以有用,部分原因是成功和失败都是可见的。

具体的科学例子:AlphaFold

蛋白质折叠成三维结构,有助于确定它们的功能。实验结构确定是必要的,但可能缓慢且困难。在名为 CASP14 的盲评估中,AlphaFold 系统预测了许多蛋白质结构,其准确度可与实验结构相媲美,并且大大优于其他计算方法。经同行评审 《自然》中的 AlphaFold 论文 解释了模型、评估及其置信度估计。

A molecular biology researcher compares a predicted folded protein with experimental evidence and confidence colors
Specialized AI can address a narrowly defined scientific problem. Predictions still carry confidence estimates and remain part of a wider research process.

这个例子很重要有两个原因。首先,它表明人工智能可以在不模仿聊天机器人的情况下为难题做出贡献。其次,系统报告其预测或多或少可靠的地方。一个有用的科学模型不仅仅产生一个美丽的结构。它为研究人员提供了有关不确定性的证据以及可以在更大的实验过程中进行测试的结果。

为什么有能力的人工智能系统仍然失败

失败并不是真正的智力之后添加的神秘缺陷。它遵循系统的构建和使用方式。多种故障模式可以同时存在。

1。目标不完整

可衡量的目标通常代表人们真正想要的结果。优化代理可能会在边缘产生奇怪的行为。该模型可能会正确地提高其分数,但会丢失该分数中从未体现的品质。人类的判断是在训练之前通过目标的选择而产生的,而不仅仅是在错误发生之后。

2.数据遗漏了一些东西

训练示例反映了集合决策和历史条件。某些群体、环境、语言、设备或罕见情况可能无法得到很好的体现。 NIST 指出,有害偏见可能会嵌入自动化系统中,并且可能会增加速度或规模。其 致力于识别和管理人工智能中的偏见 强调偏差比纯粹的技术数据问题更广泛,必须在整个系统中考虑。

3。生成模型可以产生令人信服的谎言

NIST 使用术语“虚构”来表示自信地呈现虚假或错误的生成内容。其 生成式人工智能简介 解释说,这种行为自然地遵循生成近似训练数据模式的输出的模型。一个句子可能在统计上是合理的,但没有得到事实的支持。伪造的引文尤其危险,因为它们使未经支持的答案看起来像是经过研究的。

4。世界发生了变化

昨天评估的模型明天可能会遇到新产品、新语言、新行为或新的对抗策略。准确性并不是打印在模型上的永久属性。它是在特定时间、特定条件下对特定数据进行的测量。

5。人们更信任界面而不是证据

流利的答案、自信的语气或精确的百分比可以创造出根本证据不值得拥有的权威。界面设计可以隐藏不确定性或使推荐感觉是强制性的。因此,最终风险取决于模型行为和要求人们使用输出的方式。

一个AI输出需要多少检查?

答案应该取决于犯错的成本。将每种用途都视为同样危险是不切实际的。将每个输出都视为同样值得信赖会更糟糕。简单的三区模型会有所帮助。

低风险探索

头脑风暴名称、改变草稿的语气、生成练习题或探索几种组织笔记的方法通常出错的成本很低。您可以直接检查结果并丢弃弱建议。该模型作为选项的来源很有用,而不是作为权威。

需要验证的作品

研究总结、翻译、代码、计算、产品比较和事实解释可以节省时间,但快速阅读时可能会发现错误。根据主要来源检查声明,运行代码,重现计算,将翻译与上下文进行比较,并确认引用的材料是否表达了答案的声明。

相应的决定

医疗、法律、财务、就业、安全、身份和访问决策需要合格的审查和负责任的流程。通用人工智能响应不应仅仅因为快速或清晰而成为行动的唯一基础。在这些情况下,不确定性、吸引力、文档、隐私以及对受影响人员的影响与原始预测性能一样重要。

A researcher checks an AI answer against a primary paper, a calculation, and an authoritative reference
Fluency is not evidence. Important outputs become useful only after their claims, sources, and calculations survive independent checks.

只需几分钟的验证工作流程

  1. 将事实与建议分开。拟议的大纲需要判断;有关法律、研究、价格或事件的主张需要证据。
  2. 询问每个重要主张的来源。然后打开源代码而不是相信引文文本。
  3. 尽可能优先使用主要材料:研究论文、官方文档、原始数据集、监管机构、标准或直接记录。
  4. 检查来源是否最新以及它是否支持确切的主张,而不仅仅是相同的一般主题。
  5. 通过代表性测试在安全环境中重现计算并运行生成的代码。
  6. 将相应的结论与独立来源或负责该领域的合格人员进行比较。
  7. 如果无法检查证据,请降低您的信心或不要将输出用于该决策。

文档可以在您开始之前提供帮助。该研究论文关于 模型报告模型卡 建议记录相关条件下的预期用途、评估程序、限制和性能。精美的演示会告诉您模型一次可以做什么。良好的文档有助于揭示它在哪里进行了测试以及在哪里不应该使用它。

关于任何人工智能系统要问的七个问题

  1. 该系统产生什么具体输出?
  2. 它构建或调整的优化目标是什么?
  3. 它现在收到了什么信息,缺少什么信息?
  4. 如何在与其训练示例不同的情况下进行测试?
  5. 它是否暴露了不确定性、来源、局限性或挑战结果的方法?
  6. 我可以在执行操作之前独立检查输出吗?
  7. 如果系统出错,费用谁承担?

这些问题比询问工具是否智能更具启发性。他们将注意力从营销标签转移到实际系统:它的任务、证据、边界和后果。

值得保留的心智模式

人工智能是一种在目标下将输入转化为推断输出的方法。机器学习根据示例构建该映射。深度学习使用分层神经网络来学习复杂的表示。生成式人工智能创建新材料,而语言模型通过根据上下文反复预测标记来实现这一点。这些机制都不能保证真实性、公平性、相关性或良好的判断力。

最引人注目的并不是机器变成了人。精心设计的数学系统可以在无人能手动检查的范围内发现有用的模式。负责任的回应既不是崇拜也不是排斥。这是有标准的好奇心:理解任务、寻找证据、尊重不确定性,并在后果真实的情况下保持人类责任。

主要和技术参考资料

  • 经合组织,关于人工智能系统更新定义的解释性备忘录,2024 年。
  • NIST,人工智能风险管理框架:生成人工智能概况,2024 年。
  • Vaswani 等人,注意力就是你所需要的,2017 年。
  • Jumper 等人,使用 AlphaFold 进行高度准确的蛋白质结构预测,Nature,2021。
  • Mitchell 等人,模型报告的模型卡,2019 年。
  • Google for Developers,机器学习速成课程和大型语言模型简介。