你真的懂AI是怎么工作的吗

前几天和一个做产品的朋友聊天,他说他们团队在用AI写文案、做总结、跑数据分析,但没人说得清AI内部是怎么运作的。

“就知道往里面填提示词,出来的结果有时候好有时候差,跟开盲盒一样。”

这不是个例。随着Claude、GPT、千问、DeepSeek一轮轮上新,大家都在用AI,但真正理解它"怎么工作"的人,其实不多。

今天这篇文章,我用「管家」的类比,把AI的工作原理拆成七层关系。不需要技术背景,看完你就能跟别人讲清楚,AI到底是怎么把一句话变成一篇稿子的。


一张图看懂:AI的七层关系

整个AI系统,可以想象成一家「智能管家事务所」。

你(用户)说出需求 → 管家(Agent)接收任务 → 调动技能(Skills)→ 联络外部资源(MCP)→ 按家规办事(Harness)→ 记住聊天历史(上下文)→ 把你说的话拆成文字颗粒(Token)。

这七层,从外到内,从用户到模型,环环相扣。

下面逐一拆解。


第一层:Token,文字的最小颗粒

类比:文字米粒

你发给AI的每一句话,AI回复的每一个字,在底层都会被拆成一粒粒「Token」。

Token是大模型处理文字的最小单位。英文通常是一个单词或一个子词为一个Token,中文通常是一个字或一个词为一个Token。

为什么要拆?

因为大模型不直接「读懂」文字,它读的是数字。每一个Token对应一个数字编号,模型靠这些编号来做推理。

一个直观的例子:

你输入:「帮我写一份季度总结」

这句话会被拆成大概 8~12 个 Token(取决于具体模型的分词方式),然后依次送入模型。

干货:

Token数量直接决定了两件事:

  1. 你花了多少钱(API按Token计费)
  2. 模型能「记住」多少内容(上下文窗口有限)

这也是为什么,你粘贴一份几十页的PDF进去,模型聊到后面会「忘记」前面的内容,因为上下文窗口(就是下面要讲的第三层)装不下了。


第二层:提示词,你的口头吩咐

提示词(Prompt)是你和AI交互的入口。你描述得越清楚,AI干得越准。

一个反例:

提示词:「写一篇文章」

AI:?(写什么?给谁看?多少字?什么风格?)

一个正例:

提示词:「帮我写一篇给职场新人的公众号文章,主题是’如何高效使用AI工具’,1500字左右,语气亲切、有具体案例,结尾有行动建议。」

AI:收到,马上安排。

干货:

提示词工程(Prompt Engineering)已经成为一门单独的技能。好的提示词通常有四个要素:

  • 角色:让AI扮演什么身份(如「你是一位有10年经验的产品经理」)
  • 任务:具体要做什么
  • 约束:格式、长度、风格、不能说什么
  • 范例:给1~3个参考示例(Few-shot)

不需要背模板,但需要养成「把需求说清楚」的习惯。


第三层:上下文,聊天全程备忘录

类比:管家的工作笔记本

你和AI的每一轮对话,都会被放进「上下文窗口」里,作为后续回答的参考。

这也是为什么,你在对话里前面说了「我叫小王」,后面再问「我是谁」,AI能答上来。

但上下文有三个限制:

  1. 容量有限:目前主流模型的上下文窗口在 8K~128K Token 不等(约几千到几万个汉字)。超出后,最早的内容会被「挤出去」。
  2. 不是长期记忆:关掉对话再开,上下文就清空了(除非产品层做了长期记忆功能)。
  3. 会「忘事」:当上下文很满时,模型对早期内容的注意力会下降,可能出现前后矛盾。

干货:

如果你在用AI处理长文档(比如几百页的PDF),与其全部塞进上下文,更好的做法是:

  • 用RAG(检索增强生成,见之前文章的介绍)
  • 或者把文档拆成章节,逐段处理

别让管家的笔记本太满,满了就容易出错。


第四层:Agent,全能自主大管家

一个具体场景:

你给Agent下指令:「帮我调研一下市面上3款主流AI写作工具,做一份对比表。」

如果是传统对话框,你需要分步问:

  1. 先问「有哪些AI写作工具」
  2. 再问「Notion AI怎么样」
  3. 再问「和Jasper比呢」
    …每一步都要你手动引导。

如果是Agent,它会:

  1. 自主规划:我需要先搜索,再对比,最后整理成表
  2. 调用工具:用搜索工具查资料,用爬虫读取评测
  3. 分步执行:按规划一步步来
  4. 交付结果:直接给你一份对比表

干货:

Agent = 大模型 + 工具调用 + 规划能力 + 记忆

目前主流的Agent框架(LangChain、AutoGen、CrewAI等,在之前文章里介绍过),本质上都是在解决一个问题:怎么让模型更靠谱地做规划、调工具、不出错。


第五层:Harness,家规和管理制度

类比:管家事务所的规章制度

Harness这个词在AI工程里,指的是「对模型行为的约束和管理机制」。

为什么需要约束?因为Agent太自主了也会有风险:

  • 可能调用不该调用的工具
  • 可能在没有确认的情况下执行敏感操作
  • 可能对不了模型的「幻觉」输出直接交给用户

Harness通常做这几件事:

  1. 权限控制:Agent能调哪些工具,不能调哪些
  2. 输出审查:Agent的输出要经过一层过滤(比如检查是否有敏感内容)
  3. 流程规范:规定Agent在什么情况下需要「请示用户」,什么情况下可以自主决策
  4. 错误处理:Agent失败了怎么重试、怎么回滚

干货:

如果你在搭建自己的Agent系统,Harness层的设计直接决定了系统的可靠性。

一个经验法则:凡是涉及「发送邮件」「删除文件」「对外发布内容」的操作,一定要加人工确认环节。让Agent自主「写草稿」可以,但「点发送」必须人来控制。


第六层:MCP,内部联络总交换机

类比:管家事务所的内部通讯系统

MCP(Model Context Protocol)是Anthropic(Claude的公司)2024年底推出的一个开放协议,目的是解决一个问题:

让AI模型能够统一、安全地连接各种外部工具和数据源。

在MCP出现之前,每个AI应用都要自己写一套「连接外部工具」的代码,重复劳动,而且不互通。

MCP相当于给AI模型提供了一个「标准化插座」。只要工具方按照MCP协议提供了接口,任何支持MCP的AI都能直接连上用。

目前已经支持MCP的工具包括:

  • 文件系统(读写本地文件)
  • 数据库(PostgreSQL、SQLite等)
  • 浏览器自动化
  • GitHub、GitLab
  • Slack、Notion
    …以及越来越多第三方工具。

干货:

MCP的价值在于「标准化」。就像USB接口统一了设备连接一样,MCP有望统一AI和外部工具的连接方式。

如果你是一名开发者,现在学习MCP协议的性价比很高,因为它是趋势,而且目前懂的人还不多。


第七层:Skills,管家的各项手艺

类比:管家会的具体技能包

Skills就是Agent能调用的具体能力:搜索、读文件、写代码、画图表、发邮件、做PPT…

一个关键认知:

模型本身是「通用智能」,它懂很多,但不一定擅长具体任务。Skills是把「通用能力」变成「专业能力」的桥梁。

举个例子:

Claude本身会写代码,但如果给它配上「运行代码」的Skill,它就能真的把代码跑起来、看到运行结果、然后基于结果来调试,这就从「会写」变成了「会做」。

目前最常见的Skills包括:

  • 搜索类:联网搜索、学术搜索
  • 文件类:读PDF、读Word、读Excel
  • 代码类:运行Python、执行SQL
  • 创作类:生成图片、生成图表
  • 集成类:发邮件、发企业微信、创建日历事件

干货:

如果你在用Claude、GPTs、Coze这类平台,可以主动去「Skill市场」里看看有哪些能力可以开启。很多时候,你以为AI做不到的事,其实只是一个Skill没打开而已。


七层关系:一张表总结


学完有什么用?

理解这七层关系,有三个实际好处:

第一,用AI更高效。
你知道提示词怎么写更清楚,知道上下文有什么限制,知道为什么有时候AI会「失忆」。

第二,选工具更明白。
看到一个新AI产品,你能大致判断它强在哪一层,弱在哪一层,适不适合自己的需求。

第三,如果要做AI应用,知道从哪入手。
想做Agent?先搞清楚Harness怎么设计。想接外部工具?去看看MCP协议。想让AI更专业?去配Skills。


写在最后

AI没那么神秘,也没那么简单。

说它不神秘,是因为它的核心工作原理,用「管家事务所」的类比就能讲清楚。

说它不简单,是因为每一层都有很深的技术细节,真正要做稳定、可靠、安全的AI系统,需要大量的工程实践。

这篇文章的目的,是帮你建立一个「认知框架」。有了框架,后面学什么都快。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐