返回首页
精选笔记··14 分钟阅读

AI 发展史:从图灵测试到通用智能的 80 年

一份从 1950 年图灵测试到 2026 年多模态 Agent 的完整 AI 发展史,覆盖符号主义、连接主义、深度学习、大语言模型四大范式演进,含关键论文、里程碑事件与未来趋势。

#AI 发展史#图灵测试#深度学习#LLM#Transformer#Agent

引言

"我们能制造出能思考的机器吗?" — 这个问题在 1950 年被阿兰·图灵提出,此后 AI 经历了 三次浪潮、两次寒冬,终于在 2022 年迎来了大语言模型的爆发。

本文按时间顺序梳理 AI 80 年发展史,每个阶段都回答三个问题:核心思想是什么?遇到了什么瓶颈?如何演进到下一阶段?


1. 奠基时期(1950-1956):AI 作为一门学科诞生

1.1 图灵测试(1950)

1950 年,英国数学家 阿兰·图灵 发表《Computing Machinery and Intelligence》,提出:

"机器能思考吗?" — 这个问题可以用一个模拟游戏来回答。

图灵测试:一个人类裁判通过文字对话同时询问一个人和一台机器,如果裁判无法区分谁是谁,就认为机器具有智能。

关键参数说明
测试方式纯文本对话,无视觉/听觉
通过标准30% 的裁判在 5 分钟内无法区分
意义首次给出了"智能"的可操作定义

💡 图灵测试不是衡量 AI 能力的唯一标准,但它是 AI 领域的思想原点。

1.2 达特茅斯会议(1956)

1956 年夏季,约翰·麦卡锡 在达特茅斯学院组织了一次研讨会,首次使用 Artificial Intelligence 这一术语。

核心假设

智能的每一个方面都可以被精确描述,并且可以被机器模拟。

参会者包括:

这次会议标志着 AI 作为一门独立学科的诞生。


2. 第一波浪潮:符号主义(1956-1974)

核心思想:智能 = 符号操作 + 逻辑推理

2.1 黄金十年

年份里程碑说明
1956Logic Theorist纽厄尔和西蒙,自动证明数学定理
1957GPS(通用问题求解器)纽厄尔和西蒙,用手段-目的分析解决通用问题
1958LISP 语言麦卡锡,AI 的母语,支持符号计算
1965DENDRAL斯坦福,第一个专家系统,分析有机化合物结构
1972MYCIN斯坦福,细菌感染诊断专家系统,准确率超过医生

2.2 符号主义的假设

  1. 符号主义假设:认知过程可以用符号操作来建模
  2. 物理符号系统假设:物理符号系统具有智能的充分必要条件
  3. 知识表示:框架(Minsky, 1974)、语义网络、产生式规则

2.3 第一次 AI 寒冬(1974-1980)

问题暴露

标志性事件:1974 年 Lighthill 报告,英国政府大幅削减 AI 研究经费。


3. 第二波浪潮:连接主义(1980-1993)

核心思想:智能 = 大量简单神经元的并行计算

3.1 复兴与繁荣

年份里程碑说明
1982Hopfield 网络约翰·霍普菲尔德,递归神经网络,解决组合优化
1986BackpropagationRumelhart & Hinton,反向传播算法,训练多层网络
1989LeNet-5Yann LeCun,卷积神经网络,手写数字识别
1995SVMCortes & Vapnik,支持向量机,小样本学习王者

3.2 关键突破:反向传播

1986 年,Rumelhart、Hinton、Williams 三人合作提出 Backpropagation 算法:

输入层 → 隐藏层 → 输出层
          ↓
      误差反向传播
          ↓
      梯度下降更新权重

意义:第一次让多层神经网络(深度)的训练变得可行。

3.3 第二次 AI 寒冬(1993-2006)

问题暴露

标志性事件:20 世纪 90 年代中期,AI 再次进入低谷,SVM 成为主流。


4. 第三波浪潮:深度学习(2006-2020)

核心思想:用 GPU 训练大规模神经网络,自动学习特征

4.1 关键转折点

年份里程碑说明
2006深度信念网络Hinton 团队,逐层预训练突破消失梯度
2009GPU 训练Hinton 团队,将 CNN 迁移到 GPU,速度提升 50 倍
2012AlexNetKrizhevsky 等,ImageNet 竞赛第一名,准确率 84.6%
2014VGGNetSimonyan & Zisserman,16-19 层网络,结构简单有效
2014GANGoodfellow 等,生成对抗网络,开创生成式 AI
2015ResNetHe 等,残差连接,152 层网络
2017TransformerVaswani 等,Attention 机制,NLP 里程碑

4.2 AlexNet:深度学习的起爆点

2012 年,Alex Krizhevsky 的 AlexNet 在 ImageNet 竞赛中一鸣惊人:

指标说明
网络结构5 层 CNN + 3 层全连接,60M 参数
训练硬件2 块 GTX 580 GPU
ImageNet 准确率84.6%(上一年冠军 73.8%)
意义开启了深度学习的时代

4.3 Transformer:NLP 的范式革命

2017 年,Google 发表《Attention Is All You Need》,提出 Transformer 架构:

核心创新

Transformer 架构:

输入 → Embedding + Positional Encoding
      ↓
  Multi-Head Self-Attention
      ↓
  Add & Norm + Feed-Forward
      ↓
  (重复 N 次)
      ↓
  Output

意义:Transformer 不仅统治了 NLP,后来还扩展到 CV(ViT)和多模态领域。


5. 大语言模型时代(2020-至今)

核心思想:规模即能力(Scaling Law),预训练 + 指令微调 + 对齐

5.1 预训练大模型

年份模型发布方参数量关键创新
2018BERTGoogle340M-1.1B双向掩码预训练
2019GPT-2OpenAI1.5B自回归语言模型
2020GPT-3OpenAI175BFew-shot 能力涌现
2021Switch TransformerGoogle1.6T稀疏 MoE
2022LLaMAMeta7B-65B开源高质量基座
2023GPT-4OpenAI~1T多模态 + 推理能力
2023Claude 3Anthropic7B-200B多模态 + 长上下文
2024GeminiGoogleN/A原生多模态

5.2 Scaling Law 的发现

2020-2022 年间,研究者发现了三个重要的幂律关系:

  1. Loss 与参数规模Loss ∝ 参数^(-α),α ≈ 0.07
  2. Loss 与训练数据Loss ∝ 数据^(-β),β ≈ 0.16
  3. Loss 与计算量Loss ∝ FLOPs^(-γ),γ ≈ 0.05

💡 这意味着:模型越大、数据越多、算力越强,Loss 就越低,而且没有看到天花板。这是整个 LLM 产业的理论基础。

5.3 对齐技术

从基座模型到对话助手的三步对齐:

预训练模型 → SFT → RM → RLHF/DPO
  (大量文本)  (指令数据)  (偏好数据)  (人类反馈)
技术年份说明
SFT2020监督微调,用指令-回答对训练
RLHF2022基于人类反馈的强化学习
InstructGPT2022首个对齐范式的完整实现
DPO2023直接偏好优化,无需 RL 训练
Constitutional AI2022基于原则的 AI 安全对齐

5.4 能力涌现

当模型参数超过一定阈值后,突然出现的能力:

能力出现规模说明
简单算术~1B个位数加减法
CoT 推理~100B数学应用题的链式思考
代码生成~10B能写出正确的函数
多语言~100B低资源语言突然变好
指令遵循~100B听懂复杂指令
工具使用~100B能调用计算器、搜索等

6. 生成式 AI 的三大路线

6.1 路线对比

路线代表模型核心技术优势劣势
LLMGPT-4, Claude 3自回归 Transformer通用、强推理上下文窗口有限
扩散模型Stable Diffusion, SoraDiffusion Process生成质量高慢、难以编辑
多模态Gemini, GPT-4V联合建模统一理解/生成训练成本极高

6.2 扩散模型

2020 年,DDPM(Denoising Diffusion Probabilistic Models)论文发表:

核心思想

  1. 正向过程:逐步给数据加噪声
  2. 反向过程:学习去噪,从噪声生成数据
x₀ → x₁ → x₂ → ... → xₜ  (加噪)
                              ↓ 学习反向
x₀ ← x₁ ← x₂ ← ... ← xₜ  (去噪生成)

6.3 多模态大模型

2023-2024 年,模型从纯文本扩展到多模态:


7. AI Agent 时代(2024-)

核心思想:LLM + 工具调用 + 自主规划 = Agent

7.1 Agent 简史

年份里程碑说明
2022ReActYao 等,LLM 推理 + 行动的循环
2023ToolformerSchick 等,LLM 自己学会调用工具
2023BabyAGINakajima,自主规划的通用 Agent
2024MCPAnthropic,模型上下文协议
2024Operator多个公司推出 Agent 产品

7.2 从 LLM 到 Agent 的跃迁

LLM(会说话)→ LLM + Tool Calling(会做事)→ Agent(会规划)→ 多 Agent(会协作)

Agent 四要素

  1. Planner:分解任务、制定计划
  2. Tools:调用 API、执行操作
  3. Memory:短期记忆 + 长期记忆
  4. Reflection:自我反思、纠错改进

7.3 未来趋势

趋势说明时间线
更大的上下文从 128K → 1M → 无限2024-2026
更强的多模态视频、3D、机器人2024-2026
自主 Agent长期规划、自主学习2025-2027
AGI 雏形在特定领域达到人类水平2027-2030
通用 AGI全面超过人类2030+

8. 关键论文时间线

按重要性排序的必读论文:

年份论文核心贡献
1950Computing Machinery and Intelligence图灵测试,AI 思想原点
1956Logic Theorist第一个 AI 程序
1986Learning Representations by Back-propagating Errors反向传播
1995Support-vector networksSVM
2012ImageNet Classification with Deep CNNsAlexNet,深度学习起爆
2014Generative Adversarial NetsGAN
2016Deep Residual Learning for Image RecognitionResNet
2017Attention Is All You NeedTransformer
2018BERT: Pre-training of Deep Bidirectional TransformersBERT
2020Language Models are Few-Shot LearnersGPT-3,Scaling Law
2022Training language models to follow instructions with RLHFInstructGPT
2022RAG: Retrieval-Augmented GenerationRAG 范式
2022ReAct: Synergizing Reasoning and Acting in LLMsAgent 基础
2023DPO: Direct Preference Optimization对齐新范式
2024Model Context ProtocolMCP 协议

9. 四次范式转移总结

范式时期核心思想代表技术瓶颈
符号主义1956-1974智能 = 符号 + 逻辑专家系统、LISP常识、感知、组合爆炸
连接主义1980-1993智能 = 神经元并行计算Backprop、LeNet消失梯度、数据饥渴
深度学习2006-2020智能 = 大规模特征学习CNN、Transformer缺乏推理能力
LLM/Agent2020-智能 = 规模 + 对齐 + 工具GPT-4、MCP、Agent安全性、可解释性

范式演进的规律

  1. 每次范式转移都解决了上一范式的核心瓶颈
  2. 从"人工定义特征"到"自动学习特征"
  3. 从"专用系统"到"通用系统"
  4. 从"固定逻辑"到"自主决策"

10. 未来展望

10.1 短期(2026-2028)

10.2 中期(2028-2030)

10.3 长期(2030+)

10.4 三个关键问题

  1. AGI 会以什么形式出现? 是更大的 Transformer,还是全新的架构?
  2. 人类会如何与 AGI 共存? 是替代、协作,还是融合?
  3. 我们准备好了吗? 技术发展速度远超社会制度的适应能力。

结语

从 1950 年图灵的那个问题,到 2026 年能自主写代码、做设计的 AI Agent,AI 走过了一条曲折而壮丽的道路。

三次浪潮、两次寒冬,每一次沉寂之后都是更猛烈的爆发。当前的 LLM 浪潮已经远远超出了之前的任何一次,因为它同时具备了:

未来 5 年最值得关注的方向

  1. Agent 基础设施:MCP 协议、Agent 框架、Agent 协作
  2. 端侧 AI:手机和 PC 上的本地大模型
  3. 科学 AI:AI 辅助甚至主导科学发现
  4. AI 安全:在能力爆炸的同时确保可控

"预测未来最好的方式是创造它。" — Peter Drucker