收藏!36个AI关键术语,小白也能轻松入门大模型的世界
本文介绍了36个AI领域的核心术语,涵盖了AI的基础知识、模型架构、核心技术、训练方式、应用、评估优化及伦理安全等七个方面,旨在帮助读者从概念上认识AI,适合对AI感兴趣的小白和程序员学习。
AGI、AIGC、token、Transformer、RAG、提示词…
朋友们,最近是不是被这些各式各样的AI相关的专业词汇,弄得头晕眼花,晕头转向。其实这些看着晦涩难懂的概念,背后都是些简单的逻辑。今天我们就从7个维度,把AI领域的36关键术语讲讲清楚。

- AI的底层逻辑基础知识
(1)人工智能(AI)
人工智能,英文Artificial Intelligence ,缩写为AI。
AI是计算机科学的一个分支,它是一个可以自主执行人类任务的系统。可以感知、处理数据,具有一定的学习能力。
通俗的来说就是让机器像人一样做事情。比如说用聊天机器人来代替客服回答问题。
AI的核心是输入数据,经过学习推理,输出智能结果。
(2)通用人工智能(AGI)
通用人工智能,英文Artificial General Intelligence,缩写为AGI。
AGI是AI发展的终极目标,它应该具备人类级别的跨领域学习、处理复杂任务的通用智能。
通俗的来说,现在的 AI 都是 “偏科生”—— 识图的不会聊天,下棋的不会推荐商品。
AGI 应该是 “全能学霸”,能做科研、写代码、搞设计,跨领域样样行,目前还处于研究发展阶段。

(3)复杂系统
复杂系统是有很多个组件关联构成的系统。它的整体行为不能从单个组件产生的结果推导出来,具有非线性的特征。
通俗的来说,就像马路上堵车一样,单辆车开着是正常的,但是上亿辆车连在一起,机会出现堵车这种现象,一辆车永远不可能有堵车的现象。
AI的大神经网络就是这样的,单个神经元及其简单,连在一起就产生了我们所说的智能。

(4)涌现能力
涌现能力指的是一种模型规模达到阈值之后,突然出现的新的能力,非线性增长的。这是AI飞跃的核心能力。
就像生活中,小孩子学说话一样,刚开始一个字一个字往外蹦,积累到一定程度之后,突然就能说完整的一句话,表达完整的一个意思,并且还带有一定的逻辑性。
AI大模型的参数足够大、训练数据足够多的情况下,就突然拥有角色推理、创作等能力。这就是涌现能力。
(5)世界模型
这是一种AI对于现实世界的物理规律、社会规范等现象的内在理解,目前尚未实现。
通俗的讲,现在出现的 AI 还只是 “死记硬背” 的数据关联,比如知道 “火危险” 是因为看过太多相关文字;而真正的世界模型,能像人一样理解 “火会烧人” 的底层逻辑,目前还只是理想状态。
(6)基础模型
就是一种通过大规模预训练的通用模型,它可以通过微调来适配各类垂直的任务,是现代AI开发的新范式。
通俗的讲,基础模型就是AI 的 “通用骨架”。先练出一身通用本领,再根据需求 “学专业技能。
比如说:先练会语言理解,再微调成翻译助手、写作助手,比从头训练高效百倍。
- AI的身体结构—模型架构
(7)大型语言模型(LLM)
大型语言模型,我们通常又叫它大语言模型,英文叫Large Language Model,简称LLM。
大语言模型所谓的大指的是参数,一般我们把具有数十亿到数万亿参数的深度神经网络称之为大语言模型,它专注理解和生成人类语言,是NLP的最高水平。
举几个例子,如GPT-4、Claude-4能聊天、写文章、编代码,核心是靠海量文本训练出语言规律

(8)Transformer 架构
Transformer架构是2017年谷歌提出来的,基于注意力价值,是大模型的核心架构,执行并行处理,补充长距离以来。
Transformer架构分为一个编码器和一个解码器。如图所示:

(9)混合专家模型(MoE)
混合专家模型(MoE),英文Mixture of Experts ,缩写MoE。
MoE指的是含有多个字网络“专家”和门控网络,稀疏激活,用来平平衡参数与计算效率。
通俗的讲就像在医院看病,门控网络可以理解成“导诊台”,根据你的问题,安排对应的“专家”干活,洽其他人休息。
这样子既保证了精准干活,又不浪费算力,就可以建一个超级规模的大模型,还不卡死。
(10)扩散模型
扩散模型,是一种生成式AI模型,通过模拟噪声扩散 / 逆向去噪学习数据分布,主要用来做图像 / 音视频生成。
通俗的讲就是把图像的画面拆分成“加噪声”和“去噪声”两步。
先把清晰图片慢慢弄成模糊噪声,就是我们所说的训练。再让模型学会从噪声里面一步一步的还原出清晰的图片,就说我们所说的生成。比如说现在的DALL-E、Midjourney、Sora都是这样的原理。
(11)自注意力机制
自注意力机制英文叫做Self-Attention。
它是Transformer架构的核心。通过计算QKV向量相似度,动态分配注意力权重,捕捉序列依赖。
通俗一点的讲解为,让AI自己学会“抓重点”。
比如说一句话“我在公园吃苹果,它很甜” ,能够自动的把注意力放在“它”和“苹果”的关联上,不会搞混指代关系。
(12)词嵌入(Word Embeddings)
将词汇映射到低维向量空间,语义相近的词向量距离近,这个是 NLP 的数学基础。
通俗的讲就是给每一个词发一个“数字身份证”,苹果和梨的身份证很像,苹果和汽车就差得很远。
这样子AI就可以通过数学计算来理解这个词的语义,计算出国王 - 男人 + 女人 = 王后
(13)Token 分词
token指的是一个词,子词或者一个字符。
把一句话切分成有意义的token,是AI语言处理的基础步骤。
通俗的讲,就是把一句话切成不同的词或短语。如“我喜欢学 AI” 切成 “我 | 喜欢 | 学 | AI”。
现在市面上的大模型都是以token收费的,这里所谓的token就是分词。
(14)参数
参数指的是模型内部可以学习的变量。它是AI学习到的“知识”,参数的数量决定了模型的表达能力。
通俗的讲参数就是AI的“脑细胞”,数量越多,记住的东西越多,理解能力越强。
GPT-3 有 1750 亿参数,就像有千亿个脑细胞,能处理超复杂任务。
(15)上下文长度
上下文长度指的是模型一次推理能处理的token数量。它决定了AI的短期记忆范围。
通俗的讲,它就是AI的短期记忆。
2k上下文,就只能记住几句话。
128K 上下文,能记住整本书。
记忆越长,越消耗算力。
- AI 能 “思考做事” 的核心技术
(16)规模法则
指的是模型性能与参数、数据、算力的数学关系,遵循幂律分布,指导大模型开发。
通俗的讲,AI的参数越多、数据越全、算力越足,性能越好,但不是线性的。也许投入10倍资源,性能智能提升2-4倍,越到后面越难提升。
(17)预训练
预训练指的是在海量无标注数据上的自监督学习,让模型学会语言规律和基础知识。
相当于你的“九年义务教育”,先读遍全网书籍、文章,学会基本的语言理解和常识,为后续学专业技能打基础。
(18)微调
微调 英文Fine-tuning
微调指在预训练模型基础上,用少量标注数据针对性训练,适配特定的任务。
通俗的讲,AI 上完“九年义务教育”后,再 “上专业技校”。
比如预训练会了语言理解,再用医疗数据微调,就成了医疗问答 AI,比从头训练省 99% 的力气。
(19)RLHF(人类反馈强化学习)
人类反馈强化学习就是通过人类偏好数据训练奖励模型,再用强化学习优化 AI,让输出符合人类期望。
通俗的讲,就是人类给 AI 的回答打分(好答案加分,差答案减分),AI 慢慢学会说人话、避坑,不会乱讲有害内容。
(20)少样本学习
所谓少样本学习指的是模型通过少量示例快速适应新任务,无需修改参数,降低使用门槛。
通俗的讲就是教它 1-2 个例子(比如 “开心 = 积极,糟糕 = 消极”),它就能自己做情感分析,不用再专门训练。
- AI 如何 “学会本领” —训练
(21)提示词工程
设计优化输入指令,让 AI 输出理想结果,是与 AI 交互的核心技巧。
简单来讲就是设计一段AI能够比较容易理解的话,让AI输出你想要的内容。
(22)思维链(Chain-of-Thought)
思维链,英文Chain-of-Thought简称 COT。
现在的AI很难做到推理,通过COT可以引导 AI 展示推理过程,提升复杂问题解决能力,是提示工程的高级技巧。
通俗的讲就是AI学会做题的步骤。
问 “15 个苹果给小红 40% 还剩多少”,让 AI 先算 15×0.4=6,再算 15-6=9,过程清晰,答案更准确。
(23)检索增强生成(RAG)
检索增强生成,英文Retrieval-Augmented Generation,简称RAG。
RAG指的是结合信息检索和生成模型,让 AI 基于外部知识库回答问题,减少幻觉。
通俗的讲就是给AI一个参考书,回答问题之前会去外部数据库找最新、最准确的资料,再结合资料回答,不会瞎编内容。
(24)向量数据库
向量数据库就是用来存储、索引高维向量数据,支持语义相似性检索,是 RAG 的核心组件。
通俗的来讲就是把数据通过向量的方式存起来,然后查询的时候,通过语义相似度进行查询。
(25)AI 智能体(AI Agent)
智能体指的是具备感知、计划、执行、学习能力的自主 AI 系统,能够与外部环境交互完成复杂任务。
通俗的理解就是不用你一步步指挥,告诉它 “写一篇产品推文并发布”,它会自己写文案、检查内容、调用工具发布,从 “问答助手” 变成 “行动助手”。
- 怎么判断 AI “好不好用”,如何升级
(26)基准测试(Benchmarks)
评估 AI 能力的标准化测试,涵盖语言、推理、代码等维度,是模型对比的客观标准。
通俗的讲就是让AI去参加高考,比如 MMLU 考多学科知识、HumanEval 考代码能力,分数越高,AI 能力越强,不同模型比分数就知道谁更厉害。
(27)困惑度(Perplexity)
衡量语言模型预测文本的不确定性,数值越低,预测越准确。
通俗的讲就是一种AI 的 “语言流畅度评分”,困惑度越低,AI 生成的文本越通顺、越符合人类语言习惯 —— 比如困惑度 10,就是 AI 平均从 10 个词里选一个最对的,选得越准分越低。
(28)鲁棒性(Robustness)
AI 面对输入扰动、对抗攻击时保持稳定性能的能力,是AI可靠性的关键。
通俗的讲就是指AI的抗干扰能力。比如说你打错字 “这部电影很棒棒”,鲁棒性强的 AI 仍能判断是积极评价,不会直接判错。
(29)量化(Quantization)
量化指的是降低模型参数数值精度,减少存储和计算成本,实现轻量化部署。
通俗的讲就是把 32 位的精细参数,压缩成 8 位的简化参数,模型变小、运行变快,还能在手机、手环等小设备上运行,精度损失几乎可以忽略。
(30)延迟(Latency)
延迟指的是AI 从接收输入到输出结果的时间,是实时交互的关键指标。
通俗的讲就是AI 的 “反应速度”。比如说语音识别延迟 < 100ms(你说完它立刻转文字),图像生成延迟 10-30s(需要等一会),反应越快,使用体验越好。
- AI 发展的 “底线与规矩”—伦理安全
(31)幻觉(Hallucination)
AI 生成看似合理但实际错误的信息,是统计学习的固有缺陷。
通俗的讲就是AI为了取悦用户或者什么目的,进行瞎编乱造。其实它也不是故意骗人,因为所有的输出都是基于概率的,找不到最相似的就找不太相似的,就会造成脑补的现象,其实根本就是错误的知识。
(32)偏见(Bias)
AI本质上是不会判断对错的,如果训练数据中的社会偏见很多,AI就会 输出的不公平、歧视性倾向。
通俗的讲就是如果训练数据里大多说 “医生是男性、护士是女性”,AI 可能会默认所有医生都是男性,这就是需要纠正的偏见。
(33)对齐(Alignment)
针对幻觉和偏见,人们想出了解决办法那就是对齐。也就是让 AI 的行为、价值观与人类期望一致,避免产生有害内容。
通俗的讲就是让 AI 知道什么能说、什么不能说,什么是对、什么是错,确保 AI 的发展符合人类利益。
(34)红队测试(Red Teaming)
红队测试是针对AI安全问题的,主动模拟攻击,寻找 AI 的安全漏洞,提前修复缺陷。
通俗的讲就是专门有人想方设法 “套路” AI,比如诱导它说有害内容、破解它的防护,找到漏洞后立刻修复,让 AI 更安全。
(35)可解释性 AI(XAI)
让 AI 的决策过程透明、可理解,打破 “黑盒” 困境。
通俗地讲就是让AI对自己的输出负责,每次输出都要有证据或理由。
比如 AI 判断你适合某款产品,要能说清 “因为你喜欢 A、关注 B,所以推荐 C”,而不是只给结果,让人类放心用。
(36)数据隐私(Data Privacy)
保护模型训练、交互中的个人敏感信息,防止泄露和滥用。
通俗的讲就是AI设置一个数据保密原则,你的聊天记录、个人信息,不会被 AI 随意泄露或记住,通过匿名化、加密等技术,既让 AI 学习,又保护隐私。
以上就是关于36个AI关键术语介绍,涵盖了AI 底层基础知识、模型架构、核心技术、训练方式、AI 应用、评估优化、伦理安全等七个方面。
最后
如果说程序员已经是高薪职业,那么干AI的程序员,就是高薪中的高薪。

现在的市场,已经用数据给程序员指明了方向:学AI大模型,就是冲刺高薪的最优解!

看着身边越来越多的同行转型大模型、拿到高薪offer,很多人心里都动了心,但真正的难题来了:零基础小白不知道从哪入门?有基础的程序员找不到系统学习路径?实战项目练手无门?面试不知道考什么?
别慌!今天就给大家整理了一份【2026年最新版】AI大模型免费学习资源包,覆盖从入门到实战、从理论到面试、从基础到进阶的全流程,所有资料均已整理归档,无冗余、无套路,免费分享给每一位想抓住AI风口的程序员和小白!
👇👇扫码免费领取全部内容👇👇

1、大模型系统化学习路线

2、大模型学习书籍&文档

3、AI大模型最新行业报告

4、大模型项目实战&配套源码

5、大模型大厂面试真题

四阶段精细化学习规划(附时间节点,可直接照做)
结合上述资源,给大家整理了一份可直接落地的四阶段学习规划,总时长约2个月,小白可循序渐进,程序员可根据自身基础调整节奏,高效掌握大模型核心能力,快速实现从“入门”到“能落地、能面试”的跨越。
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
👇👇扫码免费领取全部内容👇👇

6、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)