大模型技术入门必看:收藏这份小白学习指南,轻松掌握AI核心技术!
本文介绍了大模型中的核心技术包括混合专家MoE架构、LLM微调技术如LoRA、LoRA-FA、VeRA等、RAG检索增强生成系统及其改进方法如Agentic RAG、Corrective RAG、智能体设计模式如反射模式、工具使用模式、ReAct模式等、MCP模型上下文协议以及Agent2AgentA2A代理间通信协议。内容旨在帮助初学者理解和应用AI技术适合对大模型感兴趣的程序员和小白收藏学习。大模型Transformer vs. Mixture of Experts混合专家 (MoE) 是一种流行的架构它使用不同的“专家”来改进 Transformer 模型。下图解释了它们与 Transformers 的区别。图片Transformer 使用前馈网络。MoE 使用专家它们是前馈网络但与 Transformer 中的网络相比规模较小。在推理过程中会选择一部分专家。这使得 MoE 中的推理速度更快。Fine-tuning LLMs传统的微调如下图所示对于 LLM 来说是不可行的因为这些模型具有数十亿个参数并且大小为数百 GB并且并非每个人都可以使用这样的计算基础设施。值得庆幸的是今天我们有许多最佳方法来微调 LLM下面描述了五种流行的技术LoRA 添加两个低秩矩阵 A 以及 B包含可训练参数的权重矩阵。无需进行微调W只需调整这些低秩矩阵中的更新即可。LoRA-FA 虽然 LoRA 显著减少了可训练参数的总量但它仍然需要大量的激活记忆来更新低秩权重。LoRA-FAFA 代表 Frozen-A会冻结矩阵A并且仅更新矩阵B。VeRA 在 LoRA 中每一层都有一对不同的低秩矩阵A和B并且这两个矩阵都经过训练。然而在 VeRA 中矩阵A和B是冻结的、随机的并在所有模型层之间共享。VeRA 专注于学习较小的、特定于层的缩放向量记为b和d它们是此设置中唯一可训练的参数。Delta-LoRA 除了训练低秩矩阵之外W还会对矩阵进行调整但不是以传统方式。相反将两个连续训练步骤中低秩矩阵乘积与之间的差值或增量A添加B到W。LoRA 在 LoRA 中矩阵A和B都以相同的学习率更新。作者发现为矩阵设置更高的学习率B可以获得更优的收敛效果。RAG检索增强生成传统RAG传统RAG系统存在以下一些问题这些系统检索一次生成一次。这意味着如果检索到的上下文不够LLM就无法动态搜索更多信息。RAG 系统可以提供相关的上下文但无法通过复杂的查询进行推理。如果查询需要多个检索步骤传统的 RAG 就显得力不从心了。适应性较差。LLM 无法根据实际问题调整策略。Agentic RAGAgentic RAG 的工作流程如下如上所示我们的想法是在 RAG 的每个阶段引入代理行为。我们可以把智能体想象成能够主动思考任务的人——规划、调整、迭代直到找到最佳解决方案而不仅仅是遵循既定的指令。LLM 的强大功能使这一切成为可能。让我们逐步理解这一点步骤 1-2用户输入查询代理重写它删除拼写错误简化嵌入等步骤 3另一个代理决定是否需要更多细节来回答查询。步骤4如果不是则将重写的查询作为提示发送给LLM。步骤 5-8) 如果答案是肯定的另一个代理会查看其可以访问的相关资源矢量数据库、工具和 API 以及互联网并决定哪个资源有用。检索相关上下文并将其作为提示发送给 LLM。步骤9以上两条路径中的任意一条都会产生响应。步骤 10最后一个代理检查答案是否与查询和上下文相关。步骤11如果是则返回响应。步骤 12如果不是则返回步骤 1。此过程持续几次迭代直到系统承认它无法回答查询。这使得 RAG 更加稳健因为在每一步中代理行为都能确保个体结果与最终目标保持一致。Corrective RAGCorrective RAGCRAG是改进 RAG 系统的常用技术。它引入了对检索到的文档进行自我评估的步骤有助于保留生成的响应的相关性。以下是其工作原理的概述图片首先根据用户查询搜索文档。使用 LLM 评估检索到的上下文是否相关。仅保留相关上下文。如果需要的话进行网络搜索。聚合上下文并生成响应。RAG 的 5 种分块策略图片智能体5种智能体设计模式Agentic behaviors允许 LLM 通过结合自我评估、规划和协作来改进他们的输出下图展示了构建 AI 代理时采用的 5 种最流行的设计模式。图片反射模式LLM会审查其工作以发现错误并不断迭代直到产生最终的响应。工具使用模式工具允许 LLM 通过以下方式收集更多信息查询矢量数据库执行 Python 脚本调用API等这很有帮助因为 LLM 不仅仅依赖于其内部知识。ReActReason and Action模式ReAct 结合了以上两种模式代理可以反映生成的输出。它可以使用工具与世界互动。这使得它成为当今使用最强大的模式之一。规划模式AI 不会一次性解决请求而是通过以下方式创建路线图细分任务概述目标这种战略思维可以更有效地解决任务。Multi-agent模式在此设置中我们有几个agent。每个agent都被分配了专门的角色和任务。每个agent还可以访问工具。所有agent共同努力以交付最终结果同时在需要时将任务委派给其他agent。智能体系统的5个等级Agentic AI 系统不仅仅生成文本它们还可以做出决策、调用函数甚至运行自主工作流程。该图解释了人工智能代理的 5 个级别——从简单的响应者到完全自主的代理。图片基本响应器仅生成文本路由器模式决定何时采取路径工具调用选择并运行工具多代理模式管理多个代理自主模式完全独立运作MCPFunction calling MCP在 MCP 成为主流或像现在这样流行之前大多数 AI 工作流程依赖于传统的函数调用。现在MCP模型上下文协议正在改变开发人员为代理构建工具访问和编排的方式。以下是解释函数调用和 MCP 的视觉说明图片Function calling函数调用函数调用是一种机制它允许 LLM 根据用户的输入识别它需要什么工具以及何时调用它。它通常的工作方式如下LLM 收到来自用户的提示。LLM 决定其所需的工具。程序员实现程序来接受来自 LLM 的工具调用请求并准备函数调用。函数调用带有参数被传递给处理实际执行的后端服务。MCP模型上下文协议函数调用关注的是模型想要做什么而 MCP 关注的是如何让工具变得可发现和可用——尤其是跨多个代理、模型或平台。MCP 无需在每个应用程序或代理中都安装硬接线工具而是标准化工具的定义、托管和向 LLM 公开的方式。使 LLM 能够轻松发现可用的工具、了解其模式并使用它们。在调用工具之前提供批准和审计工作流程。将工具实施与消费的关注点分开。MCP A2AAgent2Agent (A2A) 协议让 AI 代理可以连接到其他代理。图片MCP 为代理提供访问工具的权限。而 A2A 允许代理与其他代理连接并以团队形式协作。Next thing在代理领域MCP 标准化了代理到工具的通信。Agent2Agent 协议标准化了 Agent 到 Agent 的通信。但还缺少一件东西……图片AG-UI代理-用户交互协议标准化了后端代理和前端 UI 之间的交互层下图绿色层。图片如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取