
Sign up to save your podcasts
Or


欢迎来到《AI深度漫谈》第十二期,也是本系列的最后一期!本期面向所有听众(从初学者到进阶者),对全系列知识进行系统回顾和未来展望。
我们一起走过了从智能体入门到高级应用的完整旅程,本期将为你梳理知识地图、推荐学习路径、分享实战建议,并展望智能体的未来发展。
本期内容大纲第一章:开场——我们一起走过的旅程系列回顾:11期内容的精彩瞬间
听众成长:从好奇观望到动手实践
本期目标:建立完整知识体系,规划未来学习路径
E01 智能体入门:定义、特征、PEAS模型、Agent Loop
E02 智能体进化史:符号主义→连接主义→LLM时代
E03 LLM底层揭秘:Transformer、提示工程、模型选型
E04 ReAct范式:思考-行动-观察循环
E05 Plan-and-Solve:规划-执行两阶段
E06 Reflection:自我反思与持续改进
E07 低代码与框架:Coze、Dify、LangGraph
E08 高级能力:记忆系统、RAG、通信协议
E09 Agentic-RL:SFT、RLHF、GRPO训练
E10 评估与优化:指标、基准测试、持续改进
E11 深度研究与多智能体:复杂案例、协作架构
必学内容:E01、E03、E04
动手实践:用Coze或Dify搭建第一个智能体
目标:理解基本概念,能完成简单任务
必学内容:E04-E08
动手实践:从零实现ReAct,接入自定义工具
目标:能根据需求定制智能体,优化性能
必学内容:E02、E03、E09、E11
动手实践:模型微调、多智能体架构设计
目标:理解底层原理,探索前沿方向
选择场景:从日常痛点出发
个人助手:日程管理、信息整理
工作辅助:文档处理、数据分析
学习工具:知识问答、语言练习
最小可行产品(MVP)
先实现核心功能
使用低代码平台快速验证
收集反馈,迭代优化
逐步增强
增加工具调用
引入记忆系统
优化提示词
误区1:追求一步到位 → 建议:从简单开始,逐步迭代
误区2:过度依赖模型能力 → 建议:系统设计弥补模型局限
误区3:忽视评估 → 建议:建立评估体系,数据驱动优化
误区4:闭门造车 → 建议:参与社区,学习他人经验
能力深化:更可靠的规划、更持久的记忆、更有效的反思
多智能体协作:从简单对话到复杂社会模拟
具身智能:从数字世界走向物理世界
人机协作:成为人类真正可信的伙伴
企业应用:客服、销售、研发辅助
个人应用:生活助手、学习伴侣、创意工具
行业变革:教育、医疗、金融、法律
官方文档:LangChain、LlamaIndex、AutoGen
开源项目:GitHub上的热门智能体项目
技术博客:关注领域专家的分享
论文阅读:arXiv上的最新研究
Discord/Slack:各大框架的官方社区
GitHub Discussions:技术交流和问题解答
中文社区:知乎、掘金、CSDN相关话题
回顾成就:我们一起完成了智能体的完整学习之旅
邀请行动:现在,轮到你来创造了
未来可期:智能体的故事才刚刚开始
感谢与祝福:感谢陪伴,期待你的作品
全系列听众:回顾知识体系
初学者:了解学习路径
进阶者:寻找深化方向
完整的11期知识地图
针对不同背景的学习路径
实战项目启动建议
持续学习资源和社区
对智能体未来的前瞻洞察
知识地图、学习路径、实战建议、未来趋势、持续学习、社区资源、从入门到精通、创造者
最后的邀请最好的学习方式,就是现在,打开电脑,开始你的第一个智能体项目。
感谢各位听众的陪伴,从E01到E12,我们一起走过了智能体从入门到精通的完整旅程。希望这期播客能成为你继续探索的起点。
记住,智能体不是终点,它是我们探索"智能"本质的漫长旅程中,一个激动人心的新站点。
从听众到创造者,你的智能体之旅,现在正式开始。
欢迎回到《AI深度漫谈》第十一期!本期是综合案例进阶,讲解DeepResearch复现、MCP应用、多智能体协作架构。
通过真实案例和架构解析,带你了解如何构建复杂的智能体系统,让多个智能体协同工作,完成单一智能体无法胜任的复杂任务。
本期内容大纲第一章:开场——深度研究智能体的应用场景什么是深度研究智能体:
能够进行多步骤信息收集
综合分析多个来源
生成结构化研究报告
应用场景:
市场调研
竞品分析
学术研究
投资分析
DeepResearch概述:OpenAI推出的深度研究功能
核心能力:
多轮搜索
信息综合
报告生成
技术架构:
规划模块:确定研究方向和步骤
搜索模块:执行多源信息检索
分析模块:整合和验证信息
生成模块:输出结构化报告
关键组件实现:
搜索工具集成(网页、数据库、API)
信息提取和去重
可信度评估
报告结构化生成
挑战和解决方案:
信息过载:智能筛选
信息冲突:多源验证
深度与广度的平衡
MCP回顾:模型上下文协议
多智能体场景下的MCP:
统一的工具接口
标准化的资源访问
跨智能体协作
实现示例:研究助手使用MCP访问多个数据源
为什么需要多智能体:
任务复杂度超出单一智能体能力
需要不同专业领域知识
并行处理提升效率
协作模式:
主从模式:一个协调者 + 多个执行者
对等模式:平等协作、分工明确
竞争模式:多个方案择优
场景分析:复杂旅行规划涉及多个领域
智能体分工:
交通智能体:负责机票、火车票
住宿智能体:负责酒店筛选
景点智能体:负责行程规划
预算智能体:负责成本控制
协作流程:
协调者接收用户需求
分发任务给各专业智能体
收集各智能体结果
综合优化生成最终方案
任务分解策略:
按领域分解
按步骤分解
按依赖关系分解
任务分配算法:
基于能力的匹配
负载均衡
优先级调度
冲突类型:
资源冲突:多个智能体竞争同一资源
结果冲突:不同智能体给出矛盾结论
优先级冲突:任务优先级不一致
解决策略:
协商机制
仲裁机制
投票机制
并行化:独立任务同时执行
缓存策略:避免重复计算
通信优化:减少智能体间通信开销
容错处理:单个智能体失败时的应对
复现建议:从简单场景开始
架构设计原则:
单一职责
松耦合
可扩展性
下一步:系列回顾与展望
希望构建复杂智能体系统的开发者
对多智能体协作感兴趣的技术人员
想了解前沿案例实现的学习者
理解DeepResearch等前沿案例的架构
掌握多智能体协作的设计方法
学会任务分解、分配和冲突解决
了解性能优化的策略
DeepResearch、深度研究、多智能体、协作架构、MCP、任务分解、冲突解决、主从模式、对等模式、并行化、智能旅行助手
实践建议从两个智能体的简单协作开始
明确每个智能体的职责边界
设计清晰的通信协议
建立有效的冲突解决机制
欢迎回到《AI深度漫谈》第十期!本期进入评估环节,讲解评估指标、基准测试、评估框架,形成"构建→评估→优化"的完整闭环。
如何知道你的智能体做得好不好?如何持续改进?本期将为你提供一套科学的评估方法论。
本期内容大纲第一章:开场——为什么需要评估没有评估就没有改进:
无法知道当前水平
无法发现改进空间
无法验证优化效果
评估的目标:
量化能力
发现问题
指导优化
准确性:任务完成的正确程度
效率:完成任务的速度和资源消耗
鲁棒性:面对异常情况的稳定性
安全性:输出内容的安全合规
用户体验:交互的自然度和满意度
完成率(Success Rate):任务成功完成的比例
步骤效率(Step Efficiency):完成任务所需的平均步骤数
准确性(Accuracy):输出结果的正确率
幻觉率(Hallucination Rate):生成虚假信息的频率
延迟(Latency):响应时间
成本(Cost):API调用成本
什么是基准测试:标准化的测试集和评估方法
主流基准测试:
GAIA:通用AI助手评估
AgentBench:智能体能力综合评估
WebArena:网页交互能力测试
SWE-bench:软件工程能力测试
基准测试的局限性
人工评估:
优点:准确、全面
缺点:成本高、速度慢
自动评估:
基于规则的评估
基于模型的评估(LLM-as-Judge)
优点:快速、可扩展
缺点:可能引入偏差
混合策略:自动评估筛选 + 人工评估验证
评估流程:
定义评估目标
选择评估指标
构建测试集
执行评估
分析结果
测试集构建:
覆盖度:不同场景、难度
质量:标注准确、边界清晰
平衡:正负样本比例
A/B测试原理:对照实验
实施步骤:
确定测试目标
设计对照组
分流用户
收集数据
统计检验
注意事项:样本量、测试时长、显著性水平
线上监控:
实时指标看板
异常告警
用户反馈收集
离线评估:
定期回归测试
新功能评估
竞品对比
问题诊断:
指标异常分析
错误案例归因
根因定位
优化策略:
提示词优化
工具改进
模型升级
架构调整
评估驱动开发:先定义评估,再开发功能
持续迭代:评估→优化→再评估
平衡指标:准确率 vs 效率 vs 成本
希望科学评估智能体的开发者
想了解评估方法论的技术人员
需要建立评估体系的产品团队
掌握智能体评估的核心指标
了解主流基准测试的特点
学会设计评估框架
建立"构建→评估→优化"的闭环思维
评估指标、基准测试、GAIA、AgentBench、完成率、幻觉率、人工评估、自动评估、A/B测试、持续监控、评估驱动开发
实践建议从核心指标开始,逐步完善评估体系
建立自动化评估流程
定期回顾评估结果,指导优化方向
结合业务目标定义评估标准
本期播客由AI系统评估专家 B 主讲,科学、数据驱动、实用导向。
欢迎回到《AI深度漫谈》第九期!本期是系列技术难度最高的一期,面向有深度学习基础的听众,讲解从SFT到GRPO的训练实战。
如果你想深入理解智能体背后的训练原理,掌握如何通过强化学习让智能体变得更聪明,本期内容将为你打开一扇新的大门。
本期内容大纲第一章:开场——为什么需要训练提示工程的局限:
无法根本改变模型能力
复杂任务表现受限
训练的价值:
注入领域知识
优化特定能力
对齐人类偏好
SFT原理:在标注数据上继续训练
数据准备:
高质量指令-响应对
数据清洗和筛选
数据增强技巧
训练流程:
学习率设置
训练轮数控制
过拟合防范
为什么需要奖励模型:量化输出质量
奖励模型训练:
偏好数据收集
排序损失函数
模型架构设计
奖励模型评估:与人类偏好的一致性
RLHF(基于人类反馈的强化学习)概述
PPO(近端策略优化)算法:
策略网络和价值网络
优势函数计算
clipped surrogate objective
RLHF训练流程:
收集人类偏好数据
训练奖励模型
使用PPO优化策略
传统RLHF vs Agentic RL:
传统:关注单轮输出质量
Agentic:关注多轮任务完成度
Agentic RL的挑战:
长程依赖
稀疏奖励
探索与利用平衡
GRPO(Group Relative Policy Optimization):
群体相对策略优化
无需价值网络
更适合智能体场景
GRPO优势:
降低内存需求
简化训练流程
更好的稳定性
GRPO实现要点
数据类型:
指令跟随数据
工具使用数据
多轮对话数据
数据质量控制:
多样性保证
难度分布
错误样本处理
环境准备:
硬件要求
框架选择(TRL、LLaMA-Factory等)
训练配置:
超参数设置
分布式训练
监控和调试:
损失曲线分析
评估指标跟踪
常见问题和解决方案:
灾难性遗忘
奖励黑客
训练不稳定
调试技巧
选择框架:
| 场景 | 提示工程 | 训练 |
|------|---------|------|
| 快速验证 | ✓ | ✗ |
| 通用能力提升 | ✗ | ✓ |
| 资源有限 | ✓ | ✗ |
混合策略:提示工程 + 轻量级微调
有深度学习基础的开发者
希望深入理解智能体训练原理的技术人员
想进行模型微调的研究者
理解SFT、RLHF、GRPO等训练方法
掌握训练数据构建的方法
了解训练流程和调试技巧
学会在提示工程和训练之间做选择
SFT、监督微调、RLHF、PPO、GRPO、奖励模型、强化学习、Agentic RL、训练数据、灾难性遗忘、奖励黑客
学习建议本期技术难度较高,建议先掌握深度学习基础
动手实践时从小规模模型开始
关注DeepSeek-R1等开源项目的训练方法
欢迎回到《AI深度漫谈》第八期!本期进入高级知识扩展,讲解记忆系统、RAG、上下文工程、MCP/A2A/ANP通信协议。
掌握这些高级能力,能让你的智能体从"能用"变成"好用",具备长期记忆、知识检索、情境理解和标准化通信的能力。
本期内容大纲第一章:开场——为什么需要高级能力基础能力的局限:
缺乏长期记忆
知识更新困难
上下文长度限制
智能体间通信困难
高级能力的价值:构建真正生产级的智能体应用
记忆的类型:
短期记忆:当前对话上下文
长期记忆:跨会话的持久化信息
工作记忆:临时存储和处理
记忆的重要性:个性化服务、连贯交互
对话历史:维护多轮对话的上下文
上下文窗口:LLM的输入长度限制
滑动窗口策略:在有限长度内保留关键信息
关键信息提取:从对话中识别重要内容
向量数据库:
嵌入(Embedding)原理
相似度检索
主流方案:Pinecone、Weaviate、Milvus
记忆存储策略:
结构化存储:关键信息提取
非结构化存储:原始对话保存
记忆检索策略:语义搜索 vs 关键词搜索
RAG原理:检索 + 生成两步走
实现流程:
文档切分与向量化
查询向量化
相似度检索
上下文增强生成
RAG优化技巧:
文档切分策略
重排序(Reranking)
查询改写
情境理解:让智能体理解当前场景
上下文压缩:在有限窗口内保留关键信息
上下文选择:动态选择最相关的历史信息
系统提示词优化:设定清晰的角色和行为规范
为什么需要协议:智能体间标准化通信
协议的作用:
统一接口规范
降低集成成本
提升互操作性
MCP(Model Context Protocol):模型上下文协议
核心概念:
资源(Resources)
工具(Tools)
提示词(Prompts)
应用场景:智能体与外部系统的标准化交互
A2A(Agent-to-Agent):智能体间通信协议
ANP(Agent Network Protocol):智能体网络协议
协议对比:不同协议的适用场景
未来趋势:智能体互联网的形成
架构设计示例:记忆 + RAG + 通信协议
性能考量:延迟、成本、准确率的平衡
最佳实践总结
希望构建生产级智能体的开发者
对记忆系统、RAG感兴趣的技术人员
想了解智能体通信协议的学习者
理解短期记忆和长期记忆的实现方法
掌握RAG的原理和优化技巧
学会上下文工程的核心技术
了解MCP、A2A、ANP等通信协议
记忆系统、短期记忆、长期记忆、向量数据库、RAG、检索增强生成、上下文工程、MCP、A2A、ANP、通信协议、Embedding
技术建议从简单的对话历史管理开始
逐步引入向量数据库存储长期记忆
RAG实现时注意文档切分粒度
关注通信协议的标准化发展
欢迎回到《AI深度漫谈》第七期!本期进入实践环节。经过6期理论学习,现在来了解更高效的开发方式。
从零实现帮助理解原理,使用工具提升效率。本期将深度体验Coze、Dify、n8n等低代码平台,以及AutoGen、AgentScope、LangGraph等主流框架,帮你找到最适合自己的智能体开发工具。
本期内容大纲第一章:开场——从零实现 vs 使用工具两种路径的关系:
从零实现:理解原理、灵活定制
使用工具:快速迭代、高效交付
本期目标:在理解原理的基础上,掌握高效开发工具
什么是低代码平台:可视化界面 + 预置组件
适用场景:快速原型、业务应用、非技术用户
平台选择维度:功能、成本、生态、可控性
平台介绍:字节跳动推出的AI应用开发平台
核心功能:
可视化工作流设计
丰富的插件生态
知识库管理
多平台发布
使用场景:客服机器人、内容生成助手
优缺点分析
平台介绍:开源的LLM应用开发平台
开源优势:
代码透明可控
支持私有化部署
活跃的社区生态
功能对比:与Coze的差异化定位
适用场景:企业级应用、数据敏感场景
平台定位:自动化工作流与智能体结合
核心特点:
强大的集成能力
可视化的工作流编排
丰富的第三方连接
适用场景:业务流程自动化、跨系统整合
适用场景:
快速验证想法
标准化业务场景
资源有限的团队
局限性:
定制化受限
性能瓶颈
厂商锁定风险
框架 vs 低代码平台:代码优先 vs 可视化优先
主流框架:
AutoGen:多智能体协作框架
AgentScope:阿里巴巴开源的智能体框架
LangGraph:基于图结构的智能体编排
核心概念:用图定义智能体工作流
状态机:管理智能体状态流转
图结构:
节点:具体操作
边:流转逻辑
循环:支持复杂交互
实战示例:构建带循环的智能体工作流
选择决策框架:
因素低代码平台开发框架开发速度快中定制能力受限高学习成本低高长期维护依赖厂商自主可控
混合策略:低代码快速验证,框架深度定制
实际使用场景对比
选型建议总结
下一步预告:探索智能体的高级能力
希望快速开发智能体的开发者
想了解不同开发工具的技术人员
需要在低代码和框架之间做选型的决策者
了解主流低代码平台的功能和特点
掌握LangGraph等框架的核心概念
学会根据场景选择合适的开发工具
建立从零实现到使用工具的完整认知
低代码、Coze、Dify、n8n、AutoGen、AgentScope、LangGraph、可视化开发、工作流、状态机、图结构
实用建议初期探索:使用低代码平台快速验证想法
产品化阶段:评估是否需要转向开发框架
企业场景:优先考虑开源框架或私有化部署
欢迎回到《AI深度漫谈》第六期!本期与前两种范式互补,讲解如何让智能体具备元认知能力,能评估执行质量并从错误中学习。
如果说ReAct让智能体能行动,Plan-and-Solve让智能体能规划,那么Reflection让智能体能成长。这是构建可靠、鲁棒智能体的关键能力。
本期内容大纲第一章:开场——为什么需要反思智能体的局限:
初始计划不完善
执行遇到意外
LLM幻觉问题
反思的价值:
元认知:知道自己知道什么、不知道什么
持续改进:从错误中学习
错误恢复:发现问题并修正
执行→反思→改进闭环
元认知能力:智能体的"自我觉察"
与ReAct、Plan-and-Solve的关系:互补而非替代
结果反思:评估最终输出是否正确
过程反思:检查执行步骤是否合理
策略反思:思考方法是否需要调整
实时反思:每步执行后立即检查
阶段反思:完成一个阶段后总结
最终反思:任务完成后整体回顾
按需反思:遇到异常时触发
反思评估代码:如何判断执行质量
改进重试机制:发现问题后如何修正
反思提示词设计:引导模型进行自我评估
错误检测:识别执行中的问题
原因分析:找出错误的根本原因
修正策略:
重新规划
调整参数
更换工具
ReAct:负责行动和探索
Plan-and-Solve:负责规划和结构
Reflection:负责评估和改进
综合架构示例:如何组合三种范式
初始执行:生成代码审查意见
反思过程:检查是否遗漏关键问题
改进输出:补充遗漏、修正错误
反思轨迹展示:完整的反思-改进过程
Reflection的核心价值:让智能体具备自我进化能力
实践建议:从简单的结果反思开始
下一步:进入低代码与框架实战环节
希望构建可靠智能体的开发者
对元认知和自我改进感兴趣的技术人员
想了解智能体高级范式的学习者
理解Reflection的核心思想和闭环机制
掌握结果、过程、策略三个反思维度
学会设计反思时机和触发条件
了解如何将三种范式综合应用
Reflection、反思、元认知、自我纠错、持续改进、ReAct、Plan-and-Solve、错误恢复、评估、改进闭环
实践建议从简单的结果反思开始实现
逐步增加过程反思和策略反思
注意反思的成本和效率平衡
结合具体应用场景设计反思机制
欢迎回到《AI深度漫谈》第五期!本期与ReAct形成方法论对比,讲解Plan-and-Solve范式。
如果说ReAct是"边想边做",那么Plan-and-Solve就是"先想后做",特别适用于结构化复杂任务。通过学习这两种范式的对比,你能更好地为不同场景选择合适的智能体架构。
本期内容大纲第一章:开场——为什么需要规划Plan-and-Solve、规划、执行、任务分解、依赖关系、重规划、ReAct对比、结构化任务、复杂任务
实用建议欢迎回到《AI深度漫谈》第四期!本期是系列第一个实战章节。在理解了LLM原理之后,现在学习如何让LLM与外部世界交互。
我们将深入讲解ReAct范式——一种让AI既能思考(Reasoning)又能行动(Acting)的经典方法。强调"从零实现"而非使用现成框架,让你真正理解智能体工作的底层逻辑。
本期内容大纲第一章:开场——为什么需要ReActReAct、Reasoning、Acting、Thought、Action、Observation、工具调用、提示词工程、智能体循环、从零实现
实战建议本期强调"从零实现",建议听众:
欢迎回到《AI深度漫谈》第三期!本期我们将潜入LLM的内部世界,去理解两个最核心的支柱:Transformer架构和提示工程。
如果把智能体比作一个机器人,那么LLM就是它的"中央处理器"加"知识库"。不了解这个"大脑"的架构和原理,我们很难真正理解智能体能力的边界在哪里,又该如何更好地使用它。
本期内容大纲第一章:开场——从"猜词游戏"到"通用大脑"Transformer、自注意力、多头注意力、位置编码、Decoder-Only、缩放法则、能力涌现、提示工程、思维链、Temperature、幻觉、RAG
From the publisher's feed