生成式 AI 入门:大语言模型与扩散模型
什么是生成式人工智能
生成式人工智能是一类能够自主创造新内容的人工智能系统,其核心能力在于从海量数据中学习概率分布,并生成全新的、符合训练数据特征的文本、图像、音频、视频或代码。与传统的判别式模型不同,生成式模型不仅仅学习分类或预测标签,而是学习数据底层的结构与规律,从而能够合成前所未有的样本。
近年来,大语言模型与扩散模型的突破性进展,将生成式 AI 推向了一个全新高度。本教程将带你从零开始,理解这两类模型的工作原理、关键技术以及实际应用。
大语言模型
大语言模型是一类基于 Transformer 架构的超大规模神经网络,通过在海量文本数据上进行预训练,习得了丰富的语言知识、常识推理与上下文理解能力。它们以自回归生成方式逐词预测下一个 token,从而完成对话、写作、翻译、代码生成等任务。
核心原理:Token 化与自注意力
大语言模型处理文本的第一步是将自然语言转换为模型可以计算的离散单元,这一过程称为 Token 化。句子被切分为 token 序列后,每个 token 会被映射为固定维度的向量表示。
自注意力机制 让模型能够动态地为输入序列中的每个词分配不同的权重,捕获远距离依赖关系。通过多头注意力,模型在多个子空间中同时学习不同类型的语言特征,如语法结构、语义角色和指代关系。Transformer 的解码器堆叠多层自注意力和前馈网络,最终输出下一个 token 的概率分布。
训练过程详解
大语言模型的训练分为两个关键阶段:
预训练阶段
在数十亿甚至数万亿 token 的文本语料上进行无监督学习。模型使用语言建模目标——给定前文,预测下一个词。通过交叉熵损失衡量预测与真实 token 的差异,反向传播更新参数。预训练让模型掌握了语言的统计规律、事实知识以及一定的推理能力。
指令微调与人类反馈强化学习
预训练后的模型虽然能续写文本,但未必能遵循人类指令。指令微调通过构造高质量的指令-回答对进行有监督训练,让模型学会理解任务意图。为进一步提升安全性和有用性,引入 RLHF——由人类标注者对多个回答进行偏好排序,训练一个奖励模型,然后使用近端策略优化算法调整生成策略,使模型输出更符合人类期望。
主流架构演进
- GPT 系列:使用自回归解码器架构,逐 token 生成,擅长开放域文本生成。
- BERT 系列:基于编码器的双向表征模型,适合理解任务,但本身非生成模型。其预训练思路为 T5、BART 等编码器-解码器生成模型奠定了基础。
- LLaMA 与开源生态:采用更高效的 Transformer 变体,如旋转位置编码、SwiGLU 激活、RMSNorm 归一化等,在更小算力下达到优异性能,推动了社区微调和垂直领域应用。
实际应用场景
- 对话助手与虚拟角色:客服系统、个人助理、游戏 NPC。
- 内容创作辅助:文章大纲、广告文案、邮件撰写、社交媒体脚本。
- 代码生成与调试:根据自然语言描述生成 Python、JavaScript 等代码,解释报错信息。
- 知识检索与摘要:结合 RAG(检索增强生成)技术,从外部知识库获取信息并生成准确回答。
- 教育与练习:生成练习题、解释复杂概念、模拟面试。
扩散模型
扩散模型是当前最主流的图像、语音和视频生成模型背后的核心驱动力。其灵感来自非平衡热力学,通过逐步向数据添加噪声并学习逆过程来生成高质量样本。
核心思想:正向扩散与反向去噪
正向扩散过程
给定一张真实图像,按固定时间步长 T 逐步向其中加入高斯噪声,直到最终变成纯噪声分布。这一过程是固定的,不需要学习,定义为马尔可夫链。
反向生成过程
训练一个神经网络(通常为 U-Net 结构)学习预测每一步加入的噪声。从随机采样的纯噪声开始,模型反复运行去噪步骤,逐步恢复出清晰的图像。每一步去噪都依赖于当前时间步的信息,以控制生成结果的精细程度。
关键技术创新
- U-Net 主干网络:对称的编码器-解码器结构,结合跳跃连接保留多尺度细节,适配高分辨率生成。
- 文本条件控制:通过 CLIP 等对比语言-图像预训练模型,将文本编码为嵌入向量,交叉注意力层注入去噪过程,实现文本到图像的生成。
- 无分类器引导:训练时同时学习条件模型和无条件模型,推理时通过混合两种预测来增强文本对齐程度,无需额外分类器。
- 潜在扩散模型:将扩散过程操作在自编码器的压缩潜在空间而非像素空间,极大降低计算成本,典型代表为 Stable Diffusion。
训练与推理优化
扩散模型的训练目标是让网络预测添加的噪声,损失函数通常使用均方误差。由于直接预测噪声比预测原图更容易,训练更加稳定。推理阶段需要数百至上千步的迭代去噪,采样速度是主要瓶颈。
加速方法包括:
- DDIM 等确定性采样器,可在减少 10-20 步的情况下保持质量。
- 渐进式蒸馏,将多步采样过程压缩进几步。
- 潜在一致性模型,直接从噪声映射到干净数据,实现一步生成。
多模态扩展与应用
- 图像生成与编辑:文生图、图生图、图像修复、超分辨率、风格迁移。
- 视频生成:在潜在扩散框架中加入时间注意力层,建模帧间连续性,生成几秒至几十秒的视频片段。
- 音频生成:将音频表示为梅尔频谱图并应用 2D 扩散模型,或直接对波形进行 1D 扩散建模,用于音乐生成、语音合成和环境声模拟。
- 3D 与分子生成:通过神经辐射场与扩散结合生成 3D 资产;在分子图结构上应用扩散模型生成候选药物分子。
两种模型的对比与互补
大语言模型与扩散模型虽然都属生成式 AI,但在数据模态、架构和生成方式上有本质差异。
| 维度 | 大语言模型 | 扩散模型 |
|---|---|---|
| 处理数据 | 离散文本(token 序列) | 连续信号(图像像素、频谱、视频帧) |
| 核心架构 | Transformer 解码器 | 卷积 U-Net 或 Transformer |
| 生成方式 | 自回归逐 token 生成 | 迭代去噪生成完整样本 |
| 关键训练目标 | 下一 token 预测 | 噪声预测 |
| 典型代表 | GPT-4, LLaMA, Claude | Stable Diffusion, DALL·E, Midjourney |
二者也正走向融合:多模态大语言模型(如 GPT-4V、Gemini)使用视觉编码器将图像转为 token,再用语言模型进行理解和生成;扩散模型也被用于语言生成,探索连续空间中的非自回归文本生成。理解两类模型的基本原理,是掌握现代生成式 AI 的基石。
学习路径与进一步探索
- 动手实践:在 Colab 中运行一个小型 GPT 训练脚本,或使用 Hugging Face
diffusers库体验 Stable Diffusion 的推理流程。 - 深入论文:阅读《Attention Is All You Need》《Denoising Diffusion Probabilistic Models》《Latent Diffusion Models》等经典文献。
- 社区生态:关注 LangChain、LlamaIndex、Stable Diffusion WebUI 等工具,了解生产级应用构建方式。
- 伦理与安全:学习生成内容的版权问题、深度伪造检测以及模型偏见缓解方法,负责任地开发与使用生成式 AI。
掌握生成式 AI 的基础原理,既能帮助你更好地使用当前工具,也为未来参与创造更智能的系统铺平道路。