AI 学习总览

AI 学习总览
AI Agent 工程实践教程 · 第 00 章
用一张学习地图串起 AI 应用开发、大模型、Agent、MCP 与项目实战的整体路线。
AI 课程前言:从会用 AI 到会开发 AI 应用
1. 为什么要学 AI 应用开发
很多人第一次接触 AI,是从聊天工具开始的:问问题、写文案、改代码、总结文档。
但在真实项目里,AI 的价值不只是“能聊天”,而是可以被接入系统,参与业务流程。
例如一个普通客服系统,过去通常是用户点击按钮、系统查询数据库、后端返回固定结果。加入 AI 之后,用户可以直接用自然语言描述问题,系统再结合知识库、订单数据和业务接口,给出回答,甚至继续创建工单、生成报告、触发后续流程。
这就是 AI 应用开发要解决的问题:
不是单独使用一个 AI 工具,而是把大模型能力接入软件系统,让它围绕业务数据、知识资料和外部工具完成任务。
所以这门课的重点不是“怎么和 AI 聊天”,而是围绕一个真实应用逐步学习:
| 要学的能力 | 解决的问题 |
|---|---|
| 调用大模型 API | 让程序真正使用模型能力 |
| 设计 Prompt | 让模型按业务要求稳定输出 |
| 管理上下文 | 让系统知道前面聊过什么、当前用户是谁 |
| 接入知识库 | 让 AI 能基于企业资料回答问题 |
| 调用工具和接口 | 让 AI 能查询数据、连接业务系统 |
| 开发 Agent | 让 AI 能拆解任务、执行步骤、返回结果 |
课程目标可以概括成一句话:
从会使用 AI,走向会开发 AI 应用。
零基础先建立 5 个概念
第一次学习 AI 应用开发,不需要一开始就记住所有英文名词。
可以先把这门课理解成一件事:
我们要把一个“会说话的大模型”,一步一步做成一个“能连接资料、调用工具、完成任务的应用”。
先记住下面 5 个核心概念:
| 概念 | 先怎么理解 | 生活里的类比 |
|---|---|---|
| 大模型 | 一个已经训练好的 AI 大脑 | 一个知识很广、但不一定了解你公司资料的助手 |
| Prompt | 给 AI 的任务说明 | 你给助手写的工作要求和回复格式 |
| RAG | 先查资料,再回答 | 开卷考试,先翻资料再作答 |
| Tools | 让 AI 调用外部工具 | 助手不只会说,还能查系统、读文件、调用接口 |
| Agent | 能拆任务、调工具、看结果、继续下一步 | 一个能按流程办事的数字员工 |
2. AI 是怎么发展到今天的
今天的大模型、RAG、Agent 不是突然出现的,而是 AI 长期演进后的结果。
AI 从“人写规则”,发展到“模型从数据中学习”,再发展到“大模型参与任务执行”。
2.1 第一阶段:规则 AI
规则 AI 本质上是一种程序化规则系统,和普通程序很像:开发者提前写好逻辑,机器按照逻辑执行。
人把经验写成规则,机器按照规则执行。
它被称为 AI,是因为早期研究者试图把某个领域的“专家经验”和“判断过程”整理成规则库,让系统具备一定的推理和决策能力。
代表产物:
- 专家系统:把医生、工程师、金融专家的经验整理成规则库
- 规则引擎:比如“如果订单金额超过 1 万,就进入人工审核”
- 早期客服机器人:用户问“退货”,系统匹配关键词,返回固定答案
- 棋类程序:通过搜索、评估函数和大量人工规则判断下一步
示例:
请假小于 3 天由主管审批,大于 3 天由经理审批;病假需要上传证明,年假不能超过余额。这类逻辑本质上就是规则驱动。
规则 AI 适合边界清楚的场景,但规则越复杂,维护成本越高;一旦遇到规则之外的问题,系统就很难处理。
2.2 第二阶段:机器学习
机器学习把 AI 从“人写规则”推进到“模型从数据中学习规律”。
不再手写全部规则,而是给模型大量样本,让模型自己学习输入和结果之间的关系。
机器学习最适合先用“预测问题”来理解。
比如要判断一笔贷款是否有风险,过去可以写很多规则:
- 年龄小于多少算高风险
- 收入低于多少算高风险
- 逾期次数超过多少算高风险
- 负债比例超过多少算高风险
但真实业务里,风险往往不是单个规则决定的,而是很多因素共同影响。机器学习的做法是:准备大量历史样本,包括用户年龄、收入、负债、逾期记录、申请金额、最终是否违约等数据,让模型从这些样本里学习“什么样的特征组合更容易产生风险”。
这就是机器学习的核心:
人提供数据和目标,模型从历史样本中学习规律,再对新数据做预测。
常见算法:
| 线性模型 | 树模型 | 距离模型 | 概率模型 | 集成模型 |
|---|---|---|---|---|
| 线性回归、逻辑回归 | 决策树、随机森林 | KNN、SVM | 朴素贝叶斯 | GBDT、XGBoost、LightGBM |
典型产物:
| 垃圾邮件识别 | 推荐系统 | 风控评分 | 广告点击率预估 | 商品销量预测 | 搜索排序 |
|---|---|---|---|---|---|
| 分类问题 | 匹配与排序 | 风险预测 | 概率预测 | 回归预测 | 排序问题 |
关键转变:
AI 不再完全依赖人工规则,而是开始依赖数据和模型。
2.3 第三阶段:深度学习
深度学习使用更深的神经网络,让模型从图片、语音、文本等复杂数据中自动学习表示。
典型技术包括:
- CNN 卷积神经网络:擅长处理图像,推动图像识别、人脸识别、医学影像识别
- RNN 循环神经网络:擅长处理序列数据,比如文本、语音、时间序列
- LSTM / GRU:RNN 的改进版本,用来缓解长序列记忆困难的问题
- Seq2Seq:把一个序列转换成另一个序列,常用于机器翻译、文本摘要
- Attention 注意力机制:让模型在处理序列时关注更重要的信息,为 Transformer 做了铺垫
典型产物:
- 图像识别
- 语音识别
- 机器翻译
- 自动驾驶感知
- 人脸识别
- NLP 文本处理
- OCR 文字识别
- 智能输入法
- 语音助手
以 RNN 为例:
RNN 像是按顺序读一句话,适合处理文本、语音这类有先后顺序的数据。例如理解“我今天不舒服,所以想请一天假”,就需要把前面的“不舒服”和后面的“请假”联系起来。
RNN 的问题是长文本容易遗忘、训练不易并行。后来 Attention 和 Transformer 正是为了解决这类问题而变得重要。
2.4 机器学习和深度学习的区别
深度学习不是和机器学习并列的另一个东西,它本质上是机器学习的一种分支。
二者最大的区别可以用一句很通俗的话理解:
传统机器学习是“人先告诉模型该看什么”;深度学习是“给模型大量样本,让它自己学会该看什么”。
用工厂质检来理解会更直观。
工厂要判断一张产品图片里有没有划痕、裂纹、污点。
| 方式 | 实际做法 | 关键差别 |
|---|---|---|
| 传统机器学习 | 工程师先告诉模型:重点看颜色有没有突变、边缘有没有断裂、纹理有没有异常、亮度有没有变化 | 人先把判断经验整理出来 |
| 深度学习 | 直接给模型看大量正常图片和瑕疵图片,让神经网络自己从图片里学会哪些地方像划痕、裂纹、污点 | 模型自己从样本里总结经验 |
再换成生活里的说法:
传统机器学习像老师先画重点:看到黑点、裂纹、边缘断掉,就可能是瑕疵。深度学习像让学生看很多合格品和不合格品,看多了以后,学生自己慢慢知道什么样的地方不对劲。
再举一个更接近业务系统的例子:客服工单自动分类。
用户提交一句话:“我昨天付款了,但是系统里还是显示未支付。”
| 方式 | 实际做法 | 关键差别 |
|---|---|---|
| 传统机器学习 | 工程师先整理特征:是否出现“付款”“未支付”“订单”“退款”等关键词,用户来自哪个页面,历史工单属于哪一类 | 人先设计判断线索 |
| 深度学习 | 直接给模型大量历史工单和分类结果,让模型自己学习句子语义,比如这句话更像“支付异常”,不是普通咨询 | 模型自己学习语义关系 |
传统机器学习更像“人把经验整理成特征,再交给模型判断”;深度学习更像“模型直接从大量样本中学习经验”。
二者不是“谁更高级就完全替代谁”,而是适合不同场景:
| 场景 | 更常见的做法 |
|---|---|
| 表格数据、风控评分、销量预测、点击率预估 | 传统机器学习仍然很常见 |
| 图片、语音、自然语言、视频、多模态 | 深度学习更有优势 |
| 数据量较小、特征清楚 | 传统机器学习更容易落地 |
| 数据量大、规则复杂、特征难以人工总结 | 深度学习更适合 |
2.5 第四阶段:Transformer 与大模型基础
2017 年,Transformer 架构出现,成为后续大语言模型的重要基础。
Transformer 的关键能力是注意力机制,它可以更好地处理长文本中的上下文关系。
模型不只是一个词一个词地看文本,而是能判断不同词之间谁更重要、谁和谁有关。
相比 RNN,Transformer 的关键优势是:
- 不再必须按顺序一个词一个词处理
- 可以并行计算,训练效率更高
- 更擅长捕捉长文本中的关联
示例:
句子“苹果发布了新手机,它的价格很高”中,“它”指的是“新手机”,不是“苹果公司”。模型需要理解词和词之间的关系,注意力机制就是帮助模型判断这些关系的重要工具。
这一阶段会出现很多名字,先不用全部记住。可以分成两类理解:
第一类是技术路线里的代表模型,主要出现在论文、教材和技术文章里:
| 名称 | 来源 | 可以先怎么理解 |
|---|---|---|
| BERT | Google,美国 | 擅长语言理解,比如分类、问答、语义匹配 |
| GPT | OpenAI,美国 | 擅长语言生成,后来发展成对话式大模型 |
| T5 | Google,美国 | 把很多 NLP 任务统一成文本到文本 |
| ViT | Google Research,美国 | 把 Transformer 用到图像任务 |
| CLIP 等多模态模型 | OpenAI 等,美国 | 开始把文本、图像等信息放在一起理解 |
第二类是今天更常见的大模型产品或模型生态,学生平时更容易遇到:
| 名称 | 公司/国家 | 可以先怎么理解 | 常见使用场景 |
|---|---|---|---|
| ChatGPT / GPT | OpenAI,美国 | 通用大模型产品和模型系列 | 问答、写作、代码、应用开发 |
| Claude | Anthropic,美国 | 常见于长文档、写作、代码协作 | 文档分析、代码理解、企业知识工作 |
| Gemini | Google,美国 | 和搜索、多模态、Google 生态结合紧密 | 图文理解、搜索增强、办公和移动场景 |
| 通义千问 / Qwen | 阿里巴巴,中国 | 中文能力和开源生态都比较常见 | 中文问答、企业接入、本地化应用 |
| 豆包 / Doubao | 字节跳动,中国 | 字节系大模型产品和 API 生态 | 内容生成、智能客服、国内业务应用 |
| DeepSeek | 深度求索,中国 | 推理、代码、中文场景讨论较多 | 推理问答、代码、应用开发 |
| Kimi | 月之暗面,中国 | 常见于长文本阅读、文档理解和资料整理 | 长文档总结、论文/合同/资料分析 |
这些名字不需要一开始全部背下来。前言阶段只要知道:它们都是大模型能力的不同入口,后面做项目时会根据场景选择合适的模型或 API。
2.6 第五阶段:大语言模型与生成式 AI
随着模型规模、训练数据和算力不断增长,大语言模型开始表现出更强的通用能力,也就是今天常说的 AIGC 和大模型时代。
典型能力:
- AI 可以理解自然语言
- AI 可以生成文章、代码、摘要、方案
- AI 可以进行多轮对话
- AI 可以根据指令完成不同任务
- AI 可以成为普通人也能使用的工具
代表产物:
- ChatGPT:让普通用户第一次大规模体验到自然语言对话能力
- Claude、Gemini、Copilot:把大模型接入办公、搜索、编程等场景
- 通义千问、豆包、文心一言、DeepSeek、Kimi:国内常见的大模型产品和 API 服务
- AI 编程助手:代码补全、代码解释、单元测试、代码审查
- AI 写作工具:文案、总结、改写、翻译、PPT 大纲
- AI 图像/视频生成工具:文生图、图生图、视频生成
示例:
以前做一个客服机器人,需要写规则、整理 FAQ、训练分类模型。现在可以直接调用大模型,让它理解用户问题,再结合业务知识库回答。这就是大模型给应用开发带来的变化。
关键变化:AI 能力开始通过 API 对外开放,开发者可以把大模型接入自己的系统。
2.7 第六阶段:AI 应用与 Agent
大模型能回答问题之后,新的问题出现了:真实业务里,用户往往不是只想问一句话,而是想完成一个任务。
例如:
- 查询资料
- 分析数据
- 读取文档
- 调用接口
- 生成报告
- 根据结果继续下一步
于是 AI 应用开始从“聊天问答”走向“任务执行”。
关键技术:
- RAG 解决“模型不知道业务资料”的问题
- Memory 解决“模型需要记住上下文”的问题
- Tools 解决“模型需要调用外部能力”的问题
- Agent 解决“模型需要完成多步骤任务”的问题
典型产物:
- 企业知识库问答系统:上传制度、产品文档、课程资料后,可以直接提问
- 智能客服 Agent:既能回答问题,也能查订单、查物流、创建工单
- 数据分析 Agent:用户用自然语言提问,系统生成 SQL、查询数据、总结结果
- 代码开发 Agent:读取项目代码,修改文件,运行测试,解释报错
- 办公自动化 Agent:整理会议纪要、生成日报、查询资料、发送通知
- 浏览器 Agent:根据目标打开网页、搜索信息、填写表单
示例:
普通聊天机器人只能回答“退款规则是什么”。RAG 机器人可以先查公司退款制度再回答。Agent 则可以进一步判断用户订单是否符合退款条件,调用订单接口查询状态,必要时创建退款申请。
Agent 不是凭空冒出来的概念,而是 AI 发展到大模型应用阶段之后,自然出现的工程方向。它代表的核心变化是:
AI 从回答问题,开始走向参与流程、调用工具、完成任务。
3. AI 应用开发到底是什么
AI 应用开发不是训练一个大模型,也不是从零研究 Transformer。
AI 应用开发可以先理解成一句话:
把大模型接入真实系统,让它围绕业务数据、用户问题和外部工具完成任务。
课程不会从零训练大模型,但需要理解必要基础原理。否则后面学习 Prompt、RAG、Memory 和 Agent 时,很难判断模型为什么会答错、为什么会遗忘、为什么需要检索和工具。
3.1 常见大模型与工具生态
先建立一个基本方位感:现在常见的大模型产品很多,但课程不要求记住所有产品差异。
常见大模型产品与工具生态:
| 产品/模型生态 | 公司/国家 | 常见入口 | 主要特点 | 适合场景 |
|---|---|---|---|---|
| OpenAI GPT / ChatGPT | OpenAI,美国 | ChatGPT、OpenAI API、Codex | 通用能力强,生态成熟,Codex 偏代码与工程 Agent | 通用问答、应用开发、代码协作、Agent |
| Anthropic Claude | Anthropic,美国 | Claude、Claude Code、API | 长文本、写作、代码协作和安全边界表现突出 | 文档分析、代码协作、企业知识工作 |
| Google Gemini | Google,美国 | Gemini App、Gemini API | 多模态、长上下文、搜索和 Google 生态结合紧密 | 多模态理解、搜索增强、移动和办公生态 |
| 通义千问 / Qwen | 阿里巴巴,中国 | 通义、Qwen、阿里云百炼 | 中文能力强,开源模型生态丰富,覆盖文本、代码、多模态 | 中文应用、私有化/本地化、企业接入 |
| 豆包 / Doubao | 字节跳动,中国 | 豆包、火山方舟 | 国内应用生态和 API 接入便利,适合快速做业务集成 | 国内业务应用、智能客服、内容生成 |
| DeepSeek、Kimi、智谱等 | 深度求索、月之暗面、智谱,中国 | 各自官网/API 平台 | 常见于推理、长文档、中文场景和行业应用探索 | 逻辑推理、长文档分析、国产模型选型 |
模型名称和版本会持续变化。课程不会绑定某一个模型,而是学习跨模型通用的开发能力:如何选择模型、如何调用 API、如何设计 Prompt、如何接入 RAG、如何开发 Agent。
3.2 本课程需要学习的核心模块
本课程需要学习的核心模块:
| 模块 | 解决的问题 | 直观理解 |
|---|---|---|
| 大模型基础 | 大模型为什么能理解和生成 | 先知道模型是怎么“看文字、学规律、生成回答”的 |
| API 调用 | 程序如何使用大模型 | 把模型能力接进自己的系统 |
| Prompt | 如何控制模型输出 | 告诉模型扮演什么角色、按什么格式回答 |
| Memory | 如何管理上下文 | 让系统知道前面聊过什么、当前会话是谁 |
| RAG | 如何回答私有知识问题 | 先查资料,再让模型基于资料回答 |
| Tools | 如何连接业务系统 | 让模型能调用接口、数据库、搜索、代码等工具 |
| Agent | 如何完成复杂任务 | 理解目标、拆解步骤、调用工具、检查结果 |
| MCP | 如何统一接入工具 | 把不同系统能力封装成 Agent 能调用的标准工具 |
| 工程能力 | 如何真正上线 | 稳定性、权限、安全、成本、日志、部署、监控 |
这些模块可以放到同一个案例里理解。
以“企业资料问答助手”为例,它会经历三个版本:
| 版本 | 能力变化 | 用到的技术 |
|---|---|---|
| 普通聊天助手 | 用户提问,AI 直接回答 | API 调用、Prompt |
| 知识库问答助手 | AI 先查询公司文档,再基于资料回答 | RAG、Embedding、向量库 |
| Agent 办事助手 | AI 不只回答,还能查订单、建工单、生成报告 | Tools、Agent、权限控制 |
3.3 典型大模型应用场景
典型大模型应用场景:
- AI 聊天助手:支持多轮对话、角色设定、上下文记忆
- 企业知识库问答:上传公司文档,员工可以直接提问
- 合同/简历/论文分析工具:自动提取重点、风险点和摘要
- 智能客服系统:结合业务知识库回答用户问题
- 代码审查助手:读取代码,发现问题,给出修改建议
- 数据分析助手:用户用自然语言提问,系统生成 SQL 或图表
- Agent 助手:能查资料、调用接口、执行步骤、返回结果
- 个人自动化助手:通过消息入口接收任务,调用工具完成邮件、日程、文件、网页等操作
这些项目背后的技术并不是孤立的,而是一套完整的能力框架。
4. Agent 和 MCP 先认识
很多人一听 Agent,会以为它是某个框架,或者是一段很高级的 Prompt。
Agent 更准确地说,是一套工程系统。
Agent 开发可以拆成两类能力:一类负责“让 Agent 会做事”,一类负责“让 Agent 稳定、安全、可交付”。
| 任务理解 | 任务拆解 | 工具调用 | 状态管理 |
|---|---|---|---|
| 把用户自然语言变成明确目标 | 把复杂目标拆成可执行步骤 | 接入数据库、接口、文件、搜索、代码等工具 | 记录当前进度、工具结果、失败原因和下一步动作 |
| 记忆管理 | 结果校验 | 安全边界 | 工程落地 |
|---|---|---|---|
| 管理对话历史、用户偏好和业务上下文 | 检查工具结果、结构化输出、重试条件和人工确认 | 控制权限、参数、白名单、高风险操作和成本 | 完成接口、前端、日志、部署、监控和异常处理 |
例如用户说:
帮我分析一下这个客户最近的订单情况,如果有异常就整理成一份报告。
一个 Agent 不能只回答“好的”,而是要完成一条完整链路:
| 步骤 | Agent 要做的事 |
|---|---|
| 理解目标 | 识别客户、时间范围、异常标准和最终交付物 |
| 拆解任务 | 规划查询数据、分析异常、生成报告几个步骤 |
| 调用工具 | 查询订单系统,读取客户资料,必要时生成图表 |
| 管理状态 | 记录哪些数据已经查到,哪些步骤还没有完成 |
| 校验结果 | 检查数据是否为空、报告格式是否正确、结论是否有依据 |
| 控制风险 | 避免查询越权数据,避免执行删除、修改等高风险操作 |
学习 Agent,不只是学习 LangChain、LangGraph、OpenClaw 等框架或工具,而是学习如何把大模型能力变成可运行、可维护、可交付的应用。
LangChain 和 LangGraph ,langSmith先认识
LangChain 和 LangGraph 可以先理解成做大模型应用时常见的开发框架。
它们不是大模型本身,而是帮助开发者把模型、Prompt、记忆、知识库、工具和任务流程组织起来。
| 工具 | 先怎么理解 | 常见作用 |
|---|---|---|
| LangChain | 大模型应用开发框架 | 把模型调用、Prompt、Memory、RAG、Tools 等能力串起来 |
| LangGraph | Agent 流程编排框架 | 把复杂任务拆成多个节点,控制每一步怎么执行、什么时候重试、什么时候结束 |
用一个实际例子理解:
如果要做一个“合同审查 Agent”,LangChain 可以负责调用模型、读取文档、检索知识库;LangGraph 可以负责把流程拆成“读取合同 -> 提取条款 -> 检查风险 -> 生成报告 -> 人工确认”几个步骤。
所以前言阶段只需要知道:
- LangChain 更偏“把大模型应用需要的能力连接起来”
- LangGraph 更偏“把 Agent 的多步骤流程管理起来”
后面的课程会在项目里详细讲它们怎么用。
MCP 在 Agent 里负责什么
MCP 可以理解成 Agent 调用工具的一种标准连接方式。
大模型本身不会直接操作数据库、浏览器、文件系统、业务系统。它需要通过工具去完成这些动作。没有统一规范时,每接一个工具都要单独写一套适配逻辑,项目很快会变乱。
MCP 解决的是“怎么把外部能力标准化地暴露给 AI 使用”的问题。
| 角色 | 作用 | 类比 |
|---|---|---|
| 大模型 | 理解用户目标,决定下一步要做什么 | 大脑 |
| Agent | 负责规划、调度、观察结果 | 项目经理 |
| MCP Server | 把某个系统能力封装成工具 | 工具接口 |
| 业务系统 | 数据库、文件、网页、订单、教务、CRM 等 | 真实工作场景 |
例如在“燕雀 + AI”项目里,可以把不同业务能力封装成 MCP 工具:
| MCP 工具 | Agent 能做什么 |
|---|---|
| 课程资料工具 | 查询课程资料、生成学习建议、整理知识点 |
| 学员信息工具 | 查询学员学习进度、作业情况、报名信息 |
| 教务工具 | 查询班级、课表、出勤、请假、作业记录 |
| 数据分析工具 | 统计转化率、完课率、活跃度、异常数据 |
| 文档工具 | 读取资料、生成报告、整理周报或教案 |
这样做的好处是:业务系统不需要直接暴露给大模型,Agent 也不需要乱调接口,而是通过 MCP 统一管理工具、权限、参数和调用结果。
热点案例:OpenClaw 与“养虾”
OpenClaw 可以作为 Agent 生态的一个热点案例。它是一个开源 AI Agent 项目,因为品牌形象和社区传播,被很多人称为“龙虾”;围绕 OpenClaw 搭建、部署、调试 Agent 的过程,也被一些开发者戏称为“养虾”。
从课程角度看,OpenClaw 的价值不在于名字,而在于它能帮助理解 Agent 应用的形态:用户通过消息入口下达任务,Agent 理解目标、调用工具、执行步骤,并在长期任务中维护状态和上下文。
5. 本课程的学习路线
课程按照“基础原理 → 应用开发 → 企业项目”的顺序推进。
前言里只需要先看清楚路线:先会调用模型,再学会控制模型、接入资料、调用工具,最后做成能演示、能部署、能讲清楚的项目。
| 阶段 | 学什么 | 解决的问题 | 对应产出 |
|---|---|---|---|
| 1. 认识大模型 | 神经网络、训练、Token、Embedding、Transformer、上下文窗口、幻觉 | 知道大模型为什么能回答,也知道它为什么会答错 | 能讲清楚大模型的基本工作方式 |
| 2. 调用模型 | 云端 API、本地模型、参数、流式输出、多轮对话、错误处理 | 让程序真正调用大模型 | 一个可运行的 AI 对话程序 |
| 3. 控制模型 | 角色 Prompt、任务 Prompt、格式约束、Few-shot、JSON 输出、提示词安全 | 让模型输出更稳定、更适合业务系统 | 一个可控输出的业务助手 |
| 4. 管理上下文 | Session、对话历史、短期记忆、长期记忆、摘要压缩、持久化记忆 | 让 AI 知道当前用户是谁、前面聊过什么 | 一个能连续对话的 AI 助手 |
| 5. 知识增强 RAG | 文档加载、切分、Embedding、向量库、Top-K、重排序、引用来源 | 让 AI 基于企业私有资料回答 | 企业知识库问答系统 |
| 6. 框架与私有化 | LlamaIndex、LangChain、向量数据库、本地模型、私有化部署 | 让项目能接入企业数据和内网环境 | 可私有化部署的知识库/助手 |
| 7. Agent 与工具 | Tools、Function Calling、ReAct、MCP、多工具协作、OpenClaw | 让 AI 不只回答,而是能调用工具执行任务 | 一个能办事的 Agent 助手 |
| 8. 企业级项目 | 燕雀业务结合、MCP 中台、权限、安全、日志、监控、成本控制 | 把 AI 能力做进真实业务系统 | 可演示、可部署、可面试的项目 |
常见开发框架先认识
前言阶段不需要掌握这些框架的全部细节,只需要知道它们分别解决哪类问题。后面课程会结合项目逐步展开。
| 类型 | 常见工具/框架 | 先怎么理解 |
|---|---|---|
| 模型接入 | OpenAI API、Claude API、Gemini API、通义千问、豆包、DeepSeek、Kimi | 提供大模型能力 |
| 本地模型与私有化 | Ollama、本地开源模型、企业内网部署 | 在本机或内网环境运行模型 |
| RAG 与知识库 | LlamaIndex、LangChain、向量数据库 | 处理文档加载、切分、索引、检索和问答 |
| Agent 编排 | LangGraph、ReAct、Function Calling | 让模型拆任务、调工具、观察结果、继续执行 |
| 工具连接 | MCP | 把数据库、文件、网页、业务系统封装成标准工具 |
| Agent 生态 | OpenClaw | 观察个人 Agent、消息入口、技能扩展和工具执行 |
| 工程支撑 | 权限、审计、日志、监控、评测、缓存、限流 | 让 AI 应用从 Demo 变成可交付系统 |
这些框架之间不是互相替代的关系,而是经常出现在同一个项目的不同位置。
课程项目会逐步升级
课程不是只做孤立 Demo,而是把项目一步步升级。
| 项目方向 | 第一版 | 进阶版 | 企业版 |
|---|---|---|---|
| AI 聊天助手 | 接入模型,完成多轮对话 | 加入 Prompt 模板和上下文记忆 | 接入用户体系、权限和日志 |
| 企业知识库 | 上传文档,完成问答 | 加入 LlamaIndex、向量库、重排序、引用来源 | 支持私有化部署、权限隔离和知识库管理 |
| 燕雀 + AI | 课程/教务/资料场景接入 AI 问答 | 结合业务数据做分析、总结、推荐 | 形成面向教育业务的 AI 助手或运营工具 |
| 数据分析助手 | 自然语言提问,生成 SQL 或图表 | 加入查询校验、结果解释和报表生成 | 接入后台数据权限、审计和可视化看板 |
| MCP 中台项目 | 封装单个工具给 Agent 调用 | 统一管理多个业务工具和调用权限 | 形成企业内部 AI 工具中台 |
| Agent 助手 | 调用一个工具完成任务 | 多工具协作、状态管理、失败重试 | 支持任务流、人工确认、监控和成本控制 |
最终目标不是只看懂概念,而是做出能运行、能演示、能讲清楚技术链路的 AI 项目。
6. AI 就业方向与面试能力
AI 相关岗位不只有算法工程师。对大多数应用开发同学来说,更现实的方向是“把大模型能力接入业务系统”。
6.1 常见就业方向
常见就业方向:
| 方向 | 主要工作 | 需要展示的能力 |
|---|---|---|
| AI 应用开发工程师 | 把大模型接入 Web、App、后台系统 | API 调用、Prompt、业务流程、接口集成 |
| RAG / 知识库工程师 | 做企业知识库问答、文档检索、可信回答 | 文档切分、Embedding、向量库、检索、重排序 |
| Agent / 智能体开发 | 让模型调用工具、拆解任务、执行流程 | Tools、Function Calling、ReAct、状态管理、安全边界 |
| AI 产品/解决方案 | 把业务问题拆成 AI 可落地方案 | 场景分析、方案设计、成本评估、效果评估 |
| AI 辅助开发方向 | 用 AI 提升代码、测试、文档、运维效率 | 代码理解、调试、自动化、工程协作 |
6.2 面试常见考察点
面试常见考察点:
- 大模型基础:Token、上下文窗口、幻觉、Temperature、Embedding
- API 调用:模型选择、参数设置、流式输出、异常重试、成本控制
- Prompt 工程:角色设定、格式约束、Few-shot、结构化输出
- RAG:文档切分、向量化、Top-K、相似度阈值、重排序、引用来源
- Agent:任务拆解、工具调用、状态管理、失败重试、权限控制
- 工程化:日志、监控、评测、缓存、限流、部署、安全边界
6.3 面试项目表达方式
面试项目需要讲清楚五件事:
- 业务问题:为什么需要 AI
- 技术方案:为什么选择 API / Prompt / RAG / Agent
- 核心实现:数据如何处理,模型如何调用,工具如何接入
- 效果验证:回答是否准确,检索是否命中,流程是否稳定
- 风险优化:幻觉、成本、权限、响应速度、异常失败怎么处理
6.4 适合准备的简历项目
适合作为简历项目的方向:
- 企业知识库问答系统
- AI 文档分析助手
- AI 客服助手
- 自然语言查数 / Text-to-SQL 助手
- 带工具调用的 Agent 助手
- AI 代码审查 / 测试生成助手
7. 课程核心观点
AI 技术变化很快,模型会更新,框架会更新,工具也会更新。
但底层能力不会轻易过时:
- 理解业务问题
- 拆解任务流程
- 管理上下文
- 连接数据和工具
- 控制风险边界
- 把 Demo 做成可用系统
这就是这门课要训练的核心能力。
AI 时代真正稀缺的,不是会不会问 AI,而是能不能把 AI 做进系统里,解决真实问题。







