第 2 课
← 返回系列列表

生成式 AI 的能力与局限

Generative AI for Everyone — 面向每个人的生成式 AI

文本生成、图像生成、代码生成的实际能力边界。

生成式 AI 的能力与局限

课程简介

文本生成、图像生成、代码生成的实际能力边界。

🎬 本课程视频:Generative AI for Everyone — 面向每个人的生成式 AI


生成式 AI 的能力与局限:文本、图像与代码生成

一、文本生成能力

大语言模型(LLM)的核心能力是对自然语言的深度理解和延续性生成。当前主流模型(GPT-4、Claude 3.5、Gemini)已经展现出了一系列令人惊叹的能力。

1.1 文本理解的深度

现代 LLM 不仅能理解字面意思,还能理解上下文、隐含意图、修辞手法和文化引用。一段包含讽刺、双关和隐喻的文字,模型能准确识别其中的多层含义。

关键能力的突破:长上下文理解。从最初的 512 tokens(GPT-1)到今天的 200K tokens(Claude 3.5),模型能够处理整本书级别的输入。这意味着你可以把整个代码库或数百页文档一次性送给模型进行分析。

1.2 知识整合与推理

LLM 在海量文本上训练,记住了大量事实性知识。但它的推理能力不同于人类的逻辑推理——更像是在上下文约束下做"模式匹配"。给定问题,模型识别出它见过的类似模式,生成该模式下的典型答案。

这种推理方式的优势和局限都很明显:优势是覆盖面广(任何写进训练数据的话题都可以谈论);局限是缺乏可靠的逻辑链条——复杂的数学推理、需要多步因果推导的问题、需要精确计数的任务,LLM 都可能出错。

1.3 创意写作

模型可以写故事、诗歌、广告文案、电影剧本——在某些创意任务上表现不俗。但需要理解:它的"创造力"本质上是对训练数据中模式的重新组合,而非真正的创意灵感。

二、图像生成能力

图像生成模型(DALL-E 3、Midjourney、Stable Diffusion)使用扩散模型——从纯噪声开始,逐步去噪,最终得到清晰的图像。

能力边界:
- 擅长:生成逼真的照片级图像、抽象艺术、特定风格的插画、产品概念图
- 不擅长:精确的文本渲染(文字经常歪歪扭扭)、复杂的物理交互(光影和反射仍不完美)、特定数量的物体("五只猫"可能画四只或六只)

三、代码生成能力

LLM 在代码生成方面的能力受到广泛关注。Claude Code、GitHub Copilot、Cursor 等工具证明了一个事实:AI 已经成为软件工程师的重要辅助工具。

能力范围:
- 完整函数生成:给定清晰的规格说明和上下文,模型能生成完整且正确的函数实现
- bug 的定位与修复:模型能分析代码、理解报错信息、定位根因并提供修复方案
- 代码解释与文档生成:将复杂逻辑用自然语言解释,自动生成文档和注释
- 测试生成:自动生成单元测试用例,覆盖正常路径和边界条件
- 跨语言翻译:将代码从一种语言翻译到另一种语言

代码生成的局限:
- 可靠性问题:生成的代码可能看起来正确但存在隐藏的 bug
- 上下文限制:对于大型代码库,模型可能忽略全局上下文而导致局部优化、全局次优
- 过时知识:训练数据截止后出现的新框架、新 API 模型不知道
- 缺乏深度理解:模型生成的代码基于模式匹配而非对问题域的深度理解

四、幻觉问题

所有生成式模型都存在幻觉问题——模型生成看似合理但实际错误的内容。原因:模型的目标是生成"最可能的下一个词",而非"事实正确的下一个词"。语言模型本质上是一个世界模型的模拟器,它在统计层面上模拟了训练数据中的知识——但模拟不是事实核查。这也是为什么所有 AI 生成内容都需要人工验证。

缓解幻觉的方法:RAG(检索增强生成)——让模型在生成答案时参考外部知识库;Chain-of-Thought 提示——引导模型逐步推理;人类反馈强化学习(RLHF)——用人类偏好微调模型。

五、总结

生成式 AI 在文本理解、图像创作和代码生成方面展现了强大的能力,但它也有明确的局限:不可靠的事实性、有限的推理能力、缺乏真正的理解。关键是把 AI 当作能力放大器而非替代品——在适当的任务上善用其优势,同时保持对输出的批判性审视。

六、多模态能力与融合

现代生成式 AI 的一个重要发展方向是多模态——在同一模型中融合文本、图像、音频甚至视频的理解和生成能力。

6.1 文本到图像

文本到图像生成(Text-to-Image)的核心技术是扩散模型。训练过程:从一张清晰的图像开始,不断添加噪声直到变成纯噪声。模型学习的是"去噪"——给定噪声图像和文本描述,预测如何去除噪声恢复原始图像。

生成过程反过来:从纯噪声图像开始,以文本描述为条件,逐步去噪直到生成清晰的图像。

主流模型对比:
- DALL-E 3:OpenAI 产品,与 ChatGPT 深度集成,理解复杂文本提示的能力最强
- Midjourney:以艺术风格闻名,生成图像的美观度被认为是最高的
- Stable Diffusion:开源模型,社区生态丰富,可以在自己的 GPU 上运行

6.2 文本到音频

文本到语音合成(TTS)和文本到音乐生成。TTS 技术从拼接合成到参数合成再到端到端深度学习。今天的模型可以生成极其逼真的人声,包含语调、停顿和情感。

文本到音乐(如 Suno、Udio):用户用自然语言描述想要的音乐风格和情绪,AI 生成完整的音乐作品——包括旋律、和声、节奏和编曲。虽然还有版权和艺术性的争议,但展示了生成式 AI 在创意领域的巨大潜力。

6.3 视频生成

视频生成是当前最具挑战但也发展最快的领域之一。Sora(OpenAI 2024 年发布)展示了从文本生成逼真视频的能力,保持了物理世界的时空连贯性。挑战包括:保持帧间一致性、处理复杂物理交互、计算成本极高。

七、在特定领域的能力与局限

7.1 法律领域

7.2 医疗领域

7.3 金融领域

7.4 教育领域

八、能力测试与基准

评估生成式 AI 能力的基准测试包括:
- MMLU(Massive Multitask Language Understanding):覆盖 57 个学科的多选题测试
- HumanEval:代码生成能力测试——从文档字符串生成函数实现
- GSM8K:小学数学应用题测试——衡量推理能力
- HELM(Holistic Evaluation of Language Models):Holistic 评估框架,覆盖多个维度

九、评估生成式 AI 应用的实际方法

在实际项目中,如何评估 AI 生成内容的质量?以下是一套实用的评估框架:

自动化评估
- BLEU / ROUGE:评估文本生成的 n-gram 重叠度——适用于翻译和摘要等有参考答案的场景
- BERTScore:利用 BERT 的语义表示评估生成文本和参考文本的语义相似度——比 BLEU 更接近人类判断
- Pass@K:评估代码生成——生成的 K 个候选中有多少个能通过测试

人工评估
- 有用性(Helpfulness):回答解决了用户的问题吗?
- 准确性(Accuracy):回答中的事实是否正确?
- 安全性(Safety):回答是否包含有害或不当内容?
- 风格适配(Style):语气、措辞是否适合目标受众?

用户反馈评估
- 显式反馈:用户的点赞/点踩、评分
- 隐式反馈:用户是否复制了回答?是否继续追问?是否修改了回答中的内容?
- 业务指标:AI 上线后相关业务指标的变化——客服解决率是否提升?用户留存是否改善?

在工程实践中,这三种评估方式组合使用——自动化评估在开发迭代时快速反馈,人工评估在发布前把关,用户反馈评估在运营阶段持续监控。

十、多模态生成能力详解

生成式 AI 早已超越了纯文本生成,多模态能力正在快速扩展。

文本到图像:DALL-E、Stable Diffusion、Midjourney 等模型可以根据文本描述生成高质量的图像。核心架构是扩散模型——从一个纯噪声图像开始,逐步去除噪声,最终生成符合描述的图像。SDXL 和 DALL-E 3 的推出使图像质量达到了接近专业摄影师的水平。

文本到视频:Sora(OpenAI)和其他的文本到视频模型可以将文本描述转化为逼真的视频片段。目前的挑战包括视频长度限制(几秒到一分钟)、物理规律的一致性(物体的运动是否符合物理法则)、角色一致性(同一个角色在不同画面中保持一致)。

文本到音乐和音频:MusicGen 和 AudioLDM 可以从文本描述生成音乐。这些模型在旋律构成、风格模仿和节奏生成方面展示了惊人的能力。ElevenLabs 的语音生成技术已经可以生成与真人难以区分的语音。

多模态理解:GPT-4V、Claude 3、Gemini 等模型可以同时理解文本和图像——识别图片中的物体、理解图表数据、阅读手写文字。这打开了全新的应用场景——从图片中提取信息、分析医学影像、辅助视觉障碍人士。

技术挑战
- 模态对齐:如何让模型理解图像中的对象和文本中的概念之间的关系
- 生成质量:高分辨率、高保真度的生成需要巨大的计算资源
- 评估困难:图像和视频的质量评估比文本更主观
- 安全风险:生成逼真的虚假内容的风险更高

未来方向是真正的统一多模态模型——一个模型同时处理文本、图像、视频、音频和代码,在模态之间自由转换和推理。

十一、生成式 AI 的局限性深入分析

了解生成式 AI 的局限性对于合理使用至关重要。

事实准确性(幻觉):大模型会生成看似合理但事实上错误的内容。这不是「bug」而是模型工作方式的固有特性——模型的目标是生成「最可能的下一个 token」,不是「陈述事实」。

缓解策略:
- RAG:检索外部知识库来约束生成内容
- 对照核实:要求模型引用信息来源,独立核实引用
- 多次采样:生成多个候选回答,检查一致性——多次回答一致的内容可信度更高
- 温度参数:降低 temperature 减少创造力,提高事实性

上下文窗口限制:虽然上下文窗口在快速增长(从 4K 到 2M),但模型对长上下文的利用效率仍不理想——位于上下文中间的信息被「遗忘」的程度更高(Lost in the Middle 现象)。关键词:将最重要的信息放在上下文的开头或结尾。

推理能力限制:大模型在需要精确计算、符号推理和多步骤推理的任务上仍然不太可靠。它们擅长「看起来像推理」的模式匹配,而非真正的逻辑推理。

知识截止日期:模型的知识停留在训练数据截止日期之前。对于需要最新信息的任务,RAG 是必需而非可选的。

输入输出长度不对称:虽然模型可以接受很长的输入,但输出长度通常有限制——这限制了模型执行长文本生成任务(如写一本书)的能力。

成本与延迟:最强大的模型往往也是最慢最贵的。在实际应用中,需要在模型能力、成本和延迟之间做权衡。不是每个场景都需要最强模型——简单任务用简单模型更经济。

选择生成式 AI 模型的决策框架
1. 任务类型——是文本生成、代码生成、图像生成还是多模态任务?不同类型有各自擅长的模型。
2. 精度要求——这个任务允许多少错误?高风险场景(如医疗诊断)需要更高的精度和可控性。
3. 延迟要求——实时交互需要低延迟(毫秒级),离线批处理可以接受更高的延迟。
4. 成本预算——更强的模型通常更贵。评估增量收益是否值得增量成本。
5. 数据隐私——数据是否可以在云端处理?是否需要本地部署?这限制了可用的模型选项。
6. 定制需求——是否需要微调模型?支持微调的模型和灵活的 API 更适合需要定制的场景。

实际项目中往往没有「最好」的模型,只有「最适合」的模型。理解需求、列出备选、做对比实验——这是选择模型的科学方法。

延伸阅读

← 生成式 AI 概述 提示词与定制化 →