跳至内容

AI 的类型:全面指南

探索人工智能的全谱系,从判别式 AI 与预测模型到自主代理与 Agentic 框架。
更新 2026年8月31日  · 15分钟

用 AI 探索

ChatGPTClaudePerplexity

如果您感觉人工智能(AI)突然无处不在,那是因为确实如此。根据麦肯锡近期的市场研究,全球 AI 采用率已从 2020–2021 年约 50–60% 的组织增长到 2025 年惊人的 88%。

不过,这种爆发式增长也带来了语言上的问题。“AI”成了一个包罗万象的流行词,用来描述差异巨大的技术——从简单的基于规则的聊天机器人、图像生成器,到科幻感十足的未来机器人,常被混为一谈。

对数据从业者而言,这种模糊性是个障碍。当利益相关方要求一个“AI 解决方案”时,您需要明确:他们需要的是一个简单的回归模型、一个生成式代理,还是一个计算机视觉系统?

在这篇全面指南中,我们将梳理这些术语。我们不会只罗列定义,而是从四个不同的视角来观察:它如何构建、能做什么、如何决策,以及如何融入现实世界的工作流。

如果您对该主题还不熟悉,建议先学习Understanding Artificial Intelligence课程。

什么是 AI?

人工智能(AI)是计算机科学的一个分支,致力于创建智能体,使其能够执行通常需要人类智能的任务,如问题求解、语音识别和决策制定。

AI 是一门跨学科科学,方法众多。它既可以是基于规则的(在预定义条件下运行),也可以使用机器学习算法从数据中学习,使系统能够适应不可预见的情境。

然而,由于研究者所称的“AI 效应”,对 AI 进行精确定义却出奇困难。该现象描述了随着技术成熟,社会对 AI 的认知不断变化。当某种能力变得司空见惯,人们就不再称其为“AI”,而是把它看作普通软件。

正因为定义在变化且范围广泛,单一分类并不足够。我们需要多个视角来获得全貌:

  • 技术:底层算法与架构。
  • 能力:从狭义到超级智能的智能水平衡量。
  • 功能:系统如何处理信息并维持记忆?

按照能力、功能与技术划分的 AI 类型。

例如,一辆自动驾驶汽车可以同时以三种方式分类:

  • 狭义 AI(基于其特定能力)。
  • 深度学习(基于其底层技术)。
  • 有限记忆(基于其功能)。

在接下来的章节中,我们将深入探讨这些具体类型。

如果您需要严格的非技术入门,建议阅读我们的AI 初学者指南

基于技术的 AI 类型

对 AI 进行最严谨的分类,是按底层技术来区分,即驱动系统的“引擎”。这种分类依据系统如何处理数据与学习来区分。下面来看不同类型。

机器学习

机器学习(ML)是 AI 的一个子集,关注让系统从数据中学习并改进,而无需为每条规则显式编程。与其写“若 A 则 B”的代码,不如给算法输入数据,让它自己发现模式。

机器学习主要分为三种学习范式,适用于不同问题类型:

  • 监督学习商业中最常见。使用带标签的数据(输入-输出对)训练算法。例如,您可以给模型展示 1,000 封标注为“垃圾”或“非垃圾”的邮件,它便会学习如何分类下一封邮件。常见算法包括线性回归K 近邻(KNN)决策树
  • 无监督学习给算法无标签数据,让其自主发现潜在结构或模式。常用于客户细分(聚类)。K-Means 聚类主成分分析(PCA)是最常用的算法之一。
  • 强化学习(RL)完全不同的路径,RL 通过奖惩机制让智能体在试错中学习。智能体根据与环境的交互获得反馈,并逐步学习哪些行为能在长期内最大化累计回报。这是训练机器人与高级博弈 AI(如 AlphaGo)的方法。

深度学习是机器学习的一个子集,而机器学习又是人工智能的一个子集。

要夯实机器学习基础,建议学习Machine Learning Fundamentals with Python技能路径。

深度学习

深度学习(DL)是受人脑结构启发的机器学习专门分支。它使用包含多层的人工神经网络(因此称为“深”)来建模海量数据集中复杂的非线性关系。传统机器学习可能在更多数据下出现瓶颈,而深度学习往往能持续提升。

关键架构包括:

  • 卷积神经网络(CNN)图像处理的黄金标准。通过“滤波器”自动扫描图像,检测如边缘、形状与纹理等空间层级。
  • 循环神经网络(RNN)为时间序列或语音等序列数据设计。保留对先前输入的“记忆”,以影响当前输出。
  • Transformer现代大语言模型(LLM)(如GPT 5.2Gemini 3)背后的架构。利用注意力机制同时处理整段序列,依据词与词之间的相对重要性加权,而非逐个处理。
  • 生成对抗网络(GAN)两个网络博弈的框架,“生成器”生成伪造数据,“判别器”尝试识别伪造。竞争促成高度逼真的合成输出。
  • 扩散模型如 Midjourney 等工具的引擎。通过学习将随机噪声系统性地逆向还原为清晰、视觉上可分辨的图像来生成高质量图像。

如果您打算亲自构建这些模型,建议从Introduction to Deep Learning with PyTorch课程开始。

自然语言处理

自然语言处理(NLP)旨在让计算机以有意义的方式理解、解释与生成自然语言。NLP 通过处理人类语言固有的歧义、上下文依赖与复杂性,架起人机沟通与机器理解之间的桥梁。

常用技术包括:

  • 情感分析分析语句背后的情绪,例如判断一条评论是积极还是消极
  • 命名实体识别(NER)在文本中识别人名或地名
  • 分词将文本拆分为更小的单元,如词、音节,甚至单个字符

下面用 Python 的transformers做一个情感分析示例:

# Example: Sentiment analysis using transformers
from transformers import pipeline
# Load pre-trained sentiment analysis model
sentiment_analyzer = pipeline("sentiment-analysis")
# Analyze multiple texts
texts = [
    "This product exceeded my expectations!",
    "Terrible customer service, very disappointed.",
    "The quality is okay, nothing special."
]
results = sentiment_analyzer(texts)
for text, result in zip(texts, results):
    print(f"Text: {text}")
    print(f"Sentiment: {result['label']}, Confidence: {result['score']:.2f}\n")
Text: This product exceeded my expectations!
Sentiment: POSITIVE, Confidence: 1.00

Text: Terrible customer service, very disappointed.
Sentiment: NEGATIVE, Confidence: 1.00

Text: The quality is okay, nothing special.
Sentiment: NEGATIVE, Confidence: 0.98

计算机视觉

计算机视觉让机器能够从数字图像与视频中提取有意义的信息,使计算机以类似人类感知的方式理解视觉数据。该领域处理对象识别、距离测量,甚至识别人类无法观察到的模式。

计算机视觉系统将图像处理技术与机器学习(尤其是深度学习)结合起来,从原始视觉数据中提取越来越抽象的表示。关键任务包括:

  • 图像分类识别图像中是什么(如“这是一只猫”)。
  • 目标检测:定位对象在哪里(如“在坐标 x,y 有一名行人”)。
  • 人脸识别基于面部特征进行身份验证。

医学影像是计算机视觉最具影响力的应用之一,AI 系统在 X 光、CT 和 MRI 中检测肿瘤的准确率可与人类放射科医师相当甚至更高。这些系统并非取代医护人员,而是为其提供支持,例如标记潜在异常以供专家审阅。

音频处理

音频处理聚焦于识别、解释与合成听觉信号,包括人类语音与环境声音。目标是让机器能够“听懂”、理解并生成音频内容,连接声学波形与语义含义。

自动语音识别(ASR)将口语转换为书面文本,为语音助手、转录服务与无障碍工具提供动力。现代 ASR 系统使用 Transformer 架构,将音频波形直接映射到文本序列,对于干净语音的准确度接近人类,并在背景噪声或口音等复杂条件下持续改进。

文本转语音(TTS)引擎如Amazon Polly执行反向操作,利用神经声码器从书面文本合成自然语音,生成逼真的韵律、语调与情感表达。现代 TTS 系统可通过几分钟的样本音频克隆声音,既带来创造性可能,也引发伦理担忧。

应用已超越语音处理,延伸至创意与实用领域。语音克隆技术支持个性化虚拟助手、稳定音色的有声书旁白,以及颇具争议的深度伪造音频。

机器人与具身智能

这是 AI 与工程学的交叉领域。具身智能(Embodied AI)指将先进的“头脑”(如视觉-语言模型)装载到实体机器人体内。虽然很多 AI 仅存在于数字形态,具身智能必须处理重力、摩擦,以及物理环境不可预测的复杂性。

这种与现实的接触引入了纯计算式 AI 所不具备的挑战,但也使其能够直接与物理世界交互。传统机器人需要为每项任务显式编程,工程师通过精确编码动作与决策树来实现特定结果。

现代具身智能系统能够理解自然语言指令,例如“把苹果捡起来”或“把那扇门打开”,并借助视觉感知识别目标并规划相应动作,而无需针对任务进行特定编程。

这一进步回应了莫拉维克悖论:对人类而言微不足道的任务,如叠衣服、开门、在杂乱房间中穿行,对机器人却极其困难;而对人类颇具挑战的任务,如下棋或微积分,对 AI 反而相对容易。

具身智能借助基础模型,正逐步弥合这一差距,让机器人具备人类视为理所当然的感知理解与自适应规划。应用包括家用的扫地机器人、工业协作机器人(cobots),以及如 Boston Dynamics 的 Atlas 等先进类人机器人。

基于能力的 AI 类型

技术定义了 AI 如何构建,能力则定义了它相对于人类智能能做什么。该分类也像一条 AI 发展的时间线,从当前局限迈向理论上的未来。

人工狭义智能

人工狭义智能(ANI)也称弱人工智能,是当下存在的 AI。它指专为特定、预定义任务而设计并在其中表现出色的系统,但一旦超出其狭窄的训练范围就会完全失效。下棋机器人不会开车,医学诊断工具也写不出诗歌。

然而,“狭义”的内涵正在扩展。当前最前沿的是先进的多模态大语言模型(LLM)。我们正见证如GPT-5.2Gemini 3等模型的发布,它们可以同时处理文本、音频与视觉输入。

尽管它们在模仿推理,但仍缺乏对世界的真正理解。开发者通常通过 API 与这些 ANI 系统交互,将其集成进应用。

ANI 内的下一步是Agentic AI。这类系统突破被动对话,能够自主执行多步动作,如浏览网页订机票,成为迈向更广泛智能的桥梁。

人工通用智能

人工通用智能(AGI)是 AI 研究的“圣杯”。它指一个理论阶段:机器具备跨完全不相关领域的学习、推理与解决问题的能力,匹配人类的认知灵活性。

关键差异在于“泛化”。一个会说葡萄牙语的 ANI 系统并不能因此更快学会西班牙语;而 AGI 系统能够将一个领域的逻辑迁移到另一个领域,而无需手动再训练。

关于 AGI 的时间表争议激烈。行业乐观者预测 2026 至 2029 年之间到来。相反,怀疑者认为我们缺乏基本架构(尤其是准确的“世界模型”),将时间线推至 2040 年或更晚。

人工超级智能

人工超级智能(ASI)描述一个假想阶段:AI 在几乎所有领域都超越最聪明的人类头脑——科学创造力、一般智慧、社交能力与问题求解。ASI 不仅能与爱因斯坦或达·芬奇比肩,还会像他们超越普通人一样大幅超越他们。

围绕 ASI 最大的担忧是递归自我改进:ASI 重新设计自身架构以变得更聪明,随后利用增强的智能进一步改进,形成失控的指数级加速智能反馈回路。

这种“智能爆炸”可能迅速产生远超人类理解的系统,使其行为难以预测,从而引发关于对齐与控制的深刻安全问题。如果 ASI 的目标与人类价值哪怕略有偏差,其卓越智能也可能以对人类有害的方式追求这些目标。

人工狭义智能 vs 人工通用智能 vs 人工超级智能

目前不存在可信的 ASI 构建路线图,许多研究者甚至质疑超级智能是否可实现或概念上是否自洽。尽管如此,ASI 的理论可能性仍推动严肃的 AI 对齐研究,旨在确保日益强大的系统保持有益且可控。

基于功能的 AI 类型

能力衡量“强度”,功能衡量系统如何与世界交互与处理数据。该分类帮助我们区分 1990 年代的国际象棋电脑与未来的社交机器人。下面逐一介绍。

反应型机器

反应型机器是最基础、最古老的 AI 形式。这类系统对过去或未来没有概念,只基于预编程规则对即时输入作出反应。

反应型 AI 的显著特征是无状态且确定性。如果您向反应型机器输入完全相同的数据十次,它会十次产生完全相同的输出。它不会从经验中学习,因为它不存储记忆。

典型例子是IBM 的 Deep Blue,这台击败加里·卡斯帕罗夫的国际象棋电脑并未学习对手的心理,只是根据当前棋局计算最佳走法。仅依据关键词、而不分析您的邮件历史就标记垃圾邮件的标准过滤器也属此类。

有限记忆 AI

有限记忆 AI 主导着现代应用。通过临时存储近期数据或上下文来做出更明智的决策,有限记忆 AI 系统实现了动态行为。与反应型机器不同,它们会在有限的上下文窗口内参考历史信息。

当今几乎所有预测式 AI 与生成式 AI 工具都属于此类。LLM(如Claude Opus 4.5)会保留对话历史,记住您几分钟前说过的话,从而在此前交流的基础上给出连贯回复。上下文窗口决定系统可参考的历史信息量。

自动驾驶汽车会在数秒内跟踪邻近车辆的速度与轨迹,预测其未来位置,而非只对当前方位作出反应。

心智理论型 AI

心智理论型 AI 处于研究原型与实用能力之间的争议地带。此类系统会对人类心理状态、信念、意图、情绪与欲望进行建模,以准确预测行为。

这对于自然的社交互动至关重要,使 AI 能解读隐含线索、识别欺骗,或根据用户情绪调整回应。

较早的前沿模型如 OpenAI 的GPT-4已在错误信念任务上达到类人水平,例如基于错误信念预测行动,正如斯坦福研究者Michal Kosinski 2024 年 PNAS 研究所示。

然而,专家仍在争论:现代 LLM 是否已可被归类为真正的心智理论系统,还是仅在语言训练中进行模式匹配。原型工作包括 DeepMind 的 ToMnet,旨在在模拟环境中推断其他智能体的信念。

自我意识型 AI

自我意识型 AI 描述的是机器具备意识、感知能力,并清楚理解自我独立于外部世界而存在的概念。

这不仅是智能,更是主观体验。这样的机器不只是处理有关自身的信息,而是具有“我存在”的切身感受,伴随相应的情感、需求与欲望。

这一层级超越了计算能力,进入关于意识本质的哲学领域。自我意识型 AI 会不会体验到疼痛、快乐,或对被关闭的恐惧?如果会,它是否应获得道德关怀或权利?这些问题将讨论从工程转向伦理。

目前尚无系统接近这一层级。虚构作品中的例子,如《2001 太空漫游》中的 HAL 9000,或《星际迷航》中的 Data,仅用于阐释概念,至于是否能实现仍属推测。

关键的 AI 模型类型

除了高层理论,数据从业者还必须理解生产中会遇到的具体架构。总体而言,当今业界使用的 AI 模型大致可分为“创造者”与“分析者”。您可以在这篇生成式与判别式模型文章中了解更多差异。

生成式 AI:创造者

生成式 AI 模型旨在生成与训练数据相似的新数据实例。它们学习数据集的底层概率分布,以生成原创的文本、图像、代码或音频。从分析到创作的转变,为规模化内容生产、创意增强与仿真带来诸多可能。

流行示例包括用于写作与编程的大语言模型如Claude;用于图像合成的扩散模型如MidjourneyNano Banana Pro;以及可模拟复杂场景的视频生成模型如Sora。值得注意的是,并非所有图像生成器都依赖扩散;例如GPT Image 1.5采用的是自回归架构。

生成式 AI 是 Agentic AI 工作流的一大进步,模型不再只是被动响应,而是主动创建资产或计划。我们稍后会更详细地讨论 AI 代理。

判别式 AI:分析者

尽管生成式 AI 更吸睛,判别式 AI(又称预测式 AI)仍是企业运营的支柱。这类模型不会创造新数据,而是学习数据集中类别之间的边界,以对输入进行分类或预测未来数值。

生成式 AI vs 判别式 AI

判别式 AI 的商业价值在于其支持决策与评估风险的能力。组织使用这些模型来自动化需要按已学规则一致执行的判断。

与生成式模型不同,判别式模型不追求创造性,而是优先考虑准确性与可靠性,常用于错误代价高的关键场景。

示例包括:

  • 预测贷款违约风险的信用评分模型。
  • 将邮件归类为垃圾或正常的垃圾邮件过滤器。
  • 识别 X 光片异常的医学诊断工具。
  • 检测欺诈交易的金融监测系统。

基础模型

基础模型在海量、多样的数据集(包括文本、图像、代码与结构化数据)上训练,学习可跨领域适用的一般模式。基础模型不仅会图像分类或文本生成;它还能形成对语言、推理与世界知识的广泛理解,并以极少的额外训练迁移到新任务。

基础模型

这种方法大幅减少了部署新应用所需的时间与数据。组织无需为每个具体问题单独构建模型,而是微调一个基础模型来应对多样任务,从法律文档分析到代码生成再到语言翻译。

我们目前也见证了小语言模型(SLM)的兴起。它们是基础模型的高效蒸馏版本,旨在本地设备(如笔记本或手机)上运行,在不依赖云端巨量算力的前提下,提供隐私与速度。

AI 代理的类型

AI 正从被动工具进化为能够执行复杂工作流的自主代理。标准模型等待输入再给出输出,而 AI 代理能够感知环境、推理如何实现目标,并采取行动执行。若要理解代理背后的架构与构建方法,建议从我们的Introduction to AI Agents课程开始。

AI 代理通常按复杂性与自主性进行分类。让我们逐一了解。

简单反射型代理

反射型代理是最简单的代理形式。它们严格遵循“条件-动作”规则,仅对当前感知作出反应,忽略历史。例如智能恒温器:若温度低于 68°F,打开加热;若高于 72°F,启动制冷。

装配线机器人也是一例;当传感器检测到部件到达指定位置时执行动作。反射型代理擅长在稳定环境下处理重复性任务,但当条件意外变化时会遇到困难,因为它们缺乏适应所需的上下文理解。

基于模型的反射型代理

基于模型的反射型代理维护一个内部世界模型,随时间跟踪状态,从而应对部分可观测环境。它们不仅会反应,还会记住必要的关键信息以确保正确运行。

自动紧急制动系统便是例子:融合雷达与摄像头数据,随时间跟踪车辆轨迹,而非仅对眼前威胁作出反应。即使信息不完整,它们也能保持准确的状态估计,例如车辆短暂被卡车遮挡后仍记住其估计位置。

目标驱动型代理

目标驱动型代理以实现特定目标为行动依据,而非单纯反应。给定“规划一趟意大利度假”这样的目标,它们会权衡多种行动序列,评估哪种能够满足目标。这代表了 Agentic AI 的前沿。

Roo Code之类的软件工程工具,或自主预订助手,会执行多步工作流,如搜索、比较、检查约束与做出决策,以完成整项工作。n8n等工作流平台可构建复杂流程,由 AI 代理处理决策点与自适应逻辑。

如果您希望夯实 AI 代理基础,建议学习我们的AI Agent Fundamentals学习路径。

效用驱动型代理 

效用驱动型代理更进一步:它们不是寻找任意可行路径,而是优化到达目标的最佳路径。其方式是使用效用函数为结果分配数值分,支持定量比较。

目标驱动型代理可能会预订任意飞往罗马的航班,而效用驱动型代理会综合成本、时长、转机次数与起飞时间等因素,以最大化总体效用。

示例包括在利润与风险之间权衡的算法交易系统,以及如 Waze 这样的导航应用,会基于用户偏好(如最快时间、最短距离或避开收费)优化路线。

学习型代理

学习型代理在未知或变化的环境中运行,通过经验持续改进而无需人工干预。其架构包括提供性能反馈的“评价器”(critic)与据此修改策略的“学习单元”。

火星车在遭遇新奇地貌时,会学习哪些地形特征意味着可安全通行。Netflix 的推荐算法是另一例子:它基于观看历史不断精炼对用户偏好的理解,从而随时间推移改进推荐。

Agentic 框架:构建代理

Agentic 框架相当于复杂代理的操作系统,将推理核心(通常为 LLM)与记忆、工具及多代理协作连接起来。它们负责管理:

  • 编排:决定哪个代理处理各个子任务,并管理组件间的工作流
  • 规划:将复杂目标拆解为可执行步骤,并在环境变化时进行调整
  • 工具使用:为代理提供搜索引擎、数据库、API 或代码执行的访问
  • 记忆:维护会话历史与超越即时交互的长期上下文

常见框架包括:

  • LangChain/LangGraph业界标准,用于将 LLM 连接至数据源,整合能力丰富。
  • Google ADK在 Vertex AI 上构建复杂代理的开源框架。
  • CrewAI编排多个角色扮演代理协作完成复杂任务。

想快速查阅这些架构,建议参考AI Agents备忘单。

结语

我们已经覆盖了大量内容,下面收个尾。

与其将 AI 视为单一技术,我们应将其视为由多种专门方法构成的多样生态,各自适用于特定问题。要全面理解 AI,需要从技术、能力与功能三种不同视角加以审视。

我们目前正处于一个关键拐点:从聚焦特定任务的狭义 AI,迈向能够自主执行复杂工作流的早期 Agentic AI 形态,推动着各行业的采用。

迈出成为 AI 专家的第一步,报名AI Fundamentals技能路径。

AI 类型常见问答

AI 的主要类型有哪些?

AI 可从三个不同视角进行分类:基于技术(机器学习、深度学习、NLP),基于能力(ANI、AGI、ASI),以及基于功能(反应型机器、有限记忆、心智理论、自我意识型 AI)。

生成式 AI 与预测式 AI 有何区别?

生成式 AI 会创建新内容,如文本、图像或代码;而预测式 AI(判别式 AI)则基于历史模式对数据进行分类并预测结果。

什么是 AI 代理?它们如何工作?

AI 代理是能自主规划并执行多步工作流的系统,它们使用语言模型进行推理,借助工具与外部交互,并通过编排层来管理任务。

什么是 Agentic AI?

Agentic AI 指能够独立执行复杂多步工作流以实现目标的自主系统,超越简单的问答,走向主动完成任务。

ANI 与 AGI 有何区别?

人工狭义智能(ANI)在特定任务上表现出色,但在训练域外会失灵;而人工通用智能(AGI)将具备跨所有领域的人类级认知灵活性,这一能力尚不存在。

主题
人工智能

AI 课程

Courses

理解 Artificial Intelligence

2小时
421.5K
了解人工智能基础概念,如机器学习、深度学习、NLP、生成式 AI 等。
查看详情Right Arrow
开始课程
查看更多Right Arrow