
目录一深度学习二神经网络1完全连接前馈神经网络2神经网络的层次三神经网络的基本概念1特征提取2权重矩阵、偏差、超参数3激活函数4梯度下降四大模型1大模型LLM2提示Prompt3会话Session4上下文Context5Prompt和Context的关系、长度限制五大模型工程0Prompt工程Prompt Engineering1MCPModel Context Protocol2Context工程Context Engineering3AI agent1外部功能调用2Context压缩2.1压缩方法一存盘重拾记忆2.2压缩方法二摘要2.3压缩方法三sub agent4agent会话六AI编程七交互界面八各家产品盘点1大模型2agent1Claude Code2OpenAI Codex3GitHub Copilot4Antigravity agent3IDE1自营路线2开放路线一深度学习深度学习是机器学习的一种方法。在过去几十年的发展中它大量借鉴了我们关于人脑神经网络、统计学和应用数学的知识。近年来得益于更强大的计算机、更大的数据集和能够训练更深网络的技术深度学习的普及性和实用性都有了极大的发展。深度学习的步骤Step1神经网络Neural networkStep2模型评估Goodness of functionStep3选择最优函数Pick best function深度学习算法是回归算法中的一种所以回归回归 Regression_nameofcsdn的博客-CSDN博客一文中的内容对深度学习都适用。二神经网络1完全连接前馈神经网络完全连接指的是相邻两层之间两两都有连接。前馈feedforward也可以称为前向从信号流向来理解就是输入信号进入网络后信号流动是单向的即信号从前一层流向后一层一直到输出层其中任意两层之间的连接并没有反馈feedback。2神经网络的层次输入层Input Layer1层隐藏层Hidden LayerN层输出层Output Layer1层而隐藏层的层数N其实就是深度学习模型的深度Deep三神经网络的基本概念1特征提取深度学习的本质就是通过隐藏层进行特征提取。隐藏层的每一层都是一次特征提取。隐藏层的最后一层到输出层的转化本质上也是特质提取。如动物识别算法两层的网络隐藏第一层的特质是毛发第二层是猫毛or狗毛输出层是猫or狗那么也可以说猫和狗也是图片的一个特征这属于比较高阶的特征。那么每一层的特征提取是怎么做的呢这其实是相当于一个0层的神经网络只有输入层和输出层它可以怎么做2权重矩阵、偏差、超参数如动物识别算法输入是32*32像素的3通道的图片输出是动物分类分10类其中f一般是根据是现成的别人研究出来的W是算法需要计算出来的而计算的过程中需要一些参数即超参数。常见的简单的网络这里的W就是权重矩阵如果再加上偏差向量b的话那么W和b都是训练算法需要计算的。而计算方法就是根据损失函数进行梯度下降。3激活函数我们用激活函数来表示不同强度的信号是否激活了神经元。激活函数4梯度下降1逐个梯度下降2批量梯度下降3随机梯度下降4小批量梯度下降法四大模型1大模型LLM大模型 Large Language Models, LLM是指参数数量庞大、拥有大量神经元的深度学习模型可以进行更复杂、更精细的任务学习和预测被广泛应用于自然语言处理、计算机视觉、语音识别等领域。2提示Prompt简单来说给大模型的一次输入就是一个Prompt用好大模型的关键就是Prompt优化。具体来说一个提示Prompt远不止一个简单的问题它是一个结构化的输入可包含多个组成部分 。这些组件共同构成了与模型沟通的完整指令指令Instructions对模型的核心任务指令明确告知模型需要执行什么操作 。主要内容/输入数据Primary Content/Input Data模型需要处理的文本或数据是分析、转换或生成任务的对象 。示例Examples/Shots演示期望的输入-输出行为为模型提供“上下文学习”In-Context Learning的基础 。线索/输出指示器Cues/Output Indicators启动模型输出的引导性词语或对输出格式如JSON、Markdown的明确要求 。支持性内容Supporting Content为模型提供的额外背景信息帮助其更好地理解任务情境。3会话Session用户和大模型之间的对话类似于用户和客服之间的对话交流结束之后对话内容就清空了。可能客户端还能看到对话历史但是服务端已经没有历史信息了。这样的一次对话称为一次会话SessionSession里面服务端可以感知对话历史Session之间是无法互相感知的。4上下文ContextSession和Context的概念是息息相关的。简单来说Context就是Session里面的所有信息。做个比喻Session是一次会议Context是一篇会议纪要。5Prompt和Context的关系、长度限制举个例子a用户prompt是什么意思bAI“Prompt”这个词在中文里通常翻译为“提示”或者“指令”。在人工智能和编程领域**prompt**指的是用户给AI模型的输入内容。c用户举个简单的例子dAI比如你想让AI帮你列一个周末的购物清单你输入的 **prompt** 可以是 “周末要办烧烤聚会帮我列一个购物清单包括食材和饮料。”在这个例子中一共有abcd四句话其中a是Prompt1c是Prompt2b和d是模型输出如果在一个新的Session里面直接输入c那大模型是理解不了的因为没有上下文语境。所以实际上输入给大模型的第一次输入是a第二次输入是abc这样随着Context越来越长超过某个常数之后大模型就无法响应了这个Session就必须结束了。五大模型工程0Prompt工程Prompt EngineeringPrompt Engineering 是一种通过设计与优化提示语Prompt引导 AI 模型生成特定响应的实践方法。从架构的角度来看Prompt Engineering 可以被视作一种“接口设计”在用户与模型之间承担“语义适配层”的角色。Prompt Engineering并没有太多需要深究的因为AI发展太快了很快Prompt Engineering就被Context Engineering替代了。1MCPModel Context Protocol昙花一现。MCP即模型上下文协议由Anthropic在2024年11月开源发布核心目标是规范LLM与外部系统的通信方式解决传统集成中适配爆炸的问题。当用户提出请求时LLM首先分析可用工具客户端通过MCP Server执行所选工具再将结果返回LLM整合生成回答流程类似检索增强生成。2Context工程Context EngineeringContext Engineering 是比Prompt Engineering更高阶、更侧重于系统设计的必要学科。Context Engineering 是一门设计、构建并优化动态自动化系统的学科旨在为大型语言模型在正确的时间、以正确的格式提供正确的信息和工具从而可靠、可扩展地完成复杂任务。新的范畴系统级指令和角色设定。对话历史短期记忆。持久化的用户偏好和事实长期记忆。动态检索的外部数据例如来自RAG。可用的工具API、函数及其定义。期望的输出格式例如JSON Schema。也就是说Context Engineering是引导大模型不要只尝试直接给出答案而是提出使用系统命令、读取外部文件、调用外部接口等需求作为输入内容的补充。举个例子大模型规划2点之间的最佳通行方案如果直接分析那只能分析空间关系、日期和时间如果提出调用地图接口那么就可以补充实时路况那么规划处的通行发方案自然更佳。3AI agentAI agent是一类产品核心技术就是Context工程。2026年3月龙虾大火自此进入AI agent的时代用户不再直接和大模型交互而是和AI agent交互。1外部功能调用包括使用系统命令、读取外部文件、调用外部接口等除了使用Context工程暗示大模型可以提出这种需求之外当大模型提出这个需求之后AI agent还需要直接去调用这些外部功能并自动获取相应的输出自动组装新的Prompt给大模型。2Context压缩2.1压缩方法一存盘重拾记忆调用了外部功能尤其是读取一个文档之后Context的大小就会急剧增加。举个例子a用户帮我规划今晚9点从上海东站到上海南站的自驾路线bAI agent规划今晚9点从上海东站到上海南站的自驾路线可以使用外部工具c大模型获取迎宾高速近5天晚上9点的路况和此刻的实时路况dAI agent好的正在打开百度地图eAI agent好的近5天晚上9点的路况和此刻的实时路况是 ¤§ | °゜¨±·×÷ˇˉˊˋ˙Γb567ΔΘΞΠΣΥΦΨΩ ¤§ | °゜¨±e5b6bthh·×÷ˇˉˊ5eb6ˋ˙ΓΔΘΞΠΣdsybv6e6b575ΥΦΨΩ ¤§ | °゜¨±·×÷ˇˉˊˋ˙ΓΔΘΞΠΣΥΦΨv65654Ω ¤§ | °゜¨±·×÷ˇˉˊˋeb565e˙ΓΔΘΞΠΣΥΦΨΩ ¤§ | °゜¨±·×÷ˇˉˊˋ˙ΓΔΘΞΠΣΥΦΨΩf大模型今晚9点从上海东站到上海南站的最优自驾路线是fsc6y4yc7n84a8n4y678每次给大模型的输入都包含了历史对话也就是说在f之后下一次的输入会以abcdefg为前缀之后的每一次输入都会带上e这个长长的内容。我们在大模型返回f之后做一次压缩把abcdef这个前缀压缩成a用户帮我规划今晚9点从上海东站到上海南站的自驾路线bAI agent规划今晚9点从上海东站到上海南站的自驾路线可以使用外部工具c大模型获取迎宾高速近5天晚上9点的路况和此刻的实时路况dAI agent好的正在打开百度地图eAI agent好的近5天晚上9点的路况和此刻的实时路况是参考“D:/20260328165730.txt”f大模型今晚9点从上海东站到上海南站的最优自驾路线是fsc6y4yc7n84a8n4y678当下次再次需要使用时D:/20260328165730.txt的内容时大模型需要输出类似于“我需要读取外部文件D:/20260328165730.txt”的请求这就是重拾记忆。2.2压缩方法二摘要实际上给大模型的输入应该是精简的上面的示例可以精简成bAI agent规划今晚9点从上海东站到上海南站的自驾路线可以使用外部工具c大模型获取迎宾高速近5天晚上9点的路况和此刻的实时路况dAI agent参考“D:/20260328165730.txt”f大模型今晚9点从上海东站到上海南站的最优自驾路线是fsc6y4yc7n84a8n4y6782.3压缩方法三sub agent当Context比较长时AI agent可以让大模型把整个Context做一次摘要。但是多次摘要的话就会损失一些重要内容。更好的解决方案是把大模型重新训练支持输出类似于“现在需要启动一个sub agent”的请求收到这个请求之后AI agent会拆分出sub agent4agent会话如果我们把直接和大模型的交互称为会话那可以把只和AI agent的交互称为agent会话。所以sub agent其实是从主agent会话中拆出1个子agent会话当sub agent退出时会生成一个返回值主agent只保留这个返回值sub agent的整个Context全部删除。类似于一个函数调用我们只保留返回值函数内的运算过程和堆栈信息全部释放掉。六AI编程只用大模型去生成代码效果不尽如人意。但是使用AI agent就差强人意了。我的AI编程实践1旋转数迷参考旋转数迷2线条拼图参考线条拼图七交互界面1GUI 包括网页端和APP端比如豆包2CLI 命令行界面3IDE 集成开发环境八各家产品盘点1大模型大模型 公司 一句话特色GPT OpenAI 最早出圈的大模型ChatGPT 背后的大脑Claude Anthropic 擅长长文理解和复杂推理代码能力强Gemini Google 多模态能力强背靠 Google 全家桶DeepSeek 深度求索 开源黑马性价比极高通义千问 阿里 国产文心一言 百度 国产glm 智谱AI 国产、强大hy4 腾讯 国产Kimi 月之暗面 国产2agent1Claude Code对接的大模型Claude其中的3个页签Chat普通对话界面就是大家最熟悉的跟 AI 聊天CodeClaude Code Agent 的图形界面版Cowork把 Agent 能力延伸到非编程领域——整理文件、做 PPT、写报告2OpenAI Codex对接的大模型GPT3GitHub Copilot对接的大模型可切换——GPT、Claude、Gemini 都可以4Antigravity agent主推Gemini 模型3IDE1自营路线IDE产品 公司 绑定agentClaude Desktop App Anthropic Claude CodeCodex App OpenAI OpenAI CodexAntigravity IDE Google Antigravity agent2开放路线IDE 模型 agentCursor Claude、GPT、Gemini、Grok Cursor Agent 、Claude Code、Codex 插件VS Code GPT、Claude、Gemini GitHub Copilot Agent 、Claude Agent、Codex AgentZed Claude、GPT、Gemini、Ollama Zed Agent Claude Agent、Codex 等Xcode Claude、GPT Claude Agent、Codex 原生集成