摘要:LLM、Token、Context、Prompt、RAG、Tool、MCP、Agent、Skill、Harness,面对层出不穷的 AI 名词,很多人只会简单和 AI 对话,并不理解背后整套运行逻辑。本文自底向上逐层拆解 AI 完整技术链路,看懂这套架构,就能快速理解绝大多数 AI 产品的工作原理,学习新工具、做 AI 落地都会事半功倍稀土掘金。
很多人每天都在使用 AI,但大多停留在输入问题、接收回答的表层。各种新概念轮番出现:LLM、Token、Context、Prompt、RAG、Tool、Agent、MCP、Skill、Harness。单独看每个名词好像都懂,但说不清它们之间的层级与依赖关系。
AI 产品不是单一模型,而是一套层层组装起来的完整系统。下面从最底层的模型引擎,一层一层向上拆解整套 AI 十层架构。
第一层:LLM 大语言模型,AI 的核心引擎
整个 AI 系统最底层的地基就是LLM 大语言模型(Large Language Model),市面上绝大多数 AI 产品,底层都依托大语言模型运行。
几乎全部主流大模型,都建立在Transformer 架构之上。2017 年 Google 发表论文《Attention Is All You Need》提出这套架构,相当于大模型的发动机;真正让这项技术大规模普及的,却是 OpenAI。2022 年底 GPT‑3.5 问世,标志大模型正式进入可用时代;2023 年 GPT‑4 发布,进一步拉高模型能力上限。如今赛道不再是一家独大,豆包、DeepSeek、Claude、Gemini 等各类大模型,都在各自领域形成竞争力。
通俗理解大模型工作原理:本质是一个高级文字接龙。当你输入问题,模型会计算预测概率最高的下一个单元,把生成的内容追加到输入末尾,继续预测下一段,循环往复直到输出结束标记,最终给到我们完整回答。这也是 AI 输出内容逐字蹦出来的根本原因。
工具调用普及之后出现新麻烦:不同厂商平台,工具接入规范互不兼容。一套天气查询工具,如果要适配多个 AI 平台,就要开发多套适配代码,维护成本极高。
MCP 全称 Model Context Protocol,模型上下文协议,是一套开放标准化协议,用来统一 AI 与外部工具、数据源的对接方式稀土掘金。
可以把 MCP 理解成 AI 世界的 USB 通用插座:工具按照 MCP 标准实现一次,所有支持 MCP 的 AI 系统,都可以直接接入这套工具,不用重复开发适配代码,解决多平台工具碎片化难题。
MCP 定义资源、工具、提示模板三类核心原语,支持本地进程调用和远程网络调用,现在已经被大量 AI 开发工具采纳腾讯云。
第八层:Agent 智能体,自主完成多步骤复杂任务