概念

到底什么是AI

AI(Artificial Intelligence)从字面上翻译就是人工智能。AI(人工智能) 简单来说,就是让机器模仿人类的智能,像人一样思考、学习、决策和解决问题。

就像教小朋友认识苹果🍎

传统计算机的方式:
你要精确地告诉它:

  • “苹果是圆形的、红色的、上面有个小梗”
  • 然后它只会认出“完美符合这些特征的”才是苹果
  • 如果看到青苹果,它就懵了:“这不是红色,所以不是苹果!”

AI的方式:
就像教小朋友认识苹果:

  • 给他看1000张各种苹果的照片(红苹果、青苹果、黄苹果、切开的苹果...)
  • 小朋友自己总结出规律:“哦,原来这种圆圆的水果,不管什么颜色都叫苹果啊!”
  • 下次看到从来没见过的苹果品种,他也能认出来

这就是AI的核心能力:
不是死记硬背规则,而是从大量例子中自己学习规律,然后处理没见过的新情况!

你想吃辣的

传统程序(固定菜单App):

if 用户选择 "辣":
推荐 = ["麻辣烫", "水煮鱼", "辣子鸡"]  // 写死的列表
else:
推荐 = ["米饭", "面条"]  // 写死的列表

🔴 问题:

  • 如果新出"辣条炒饭",程序不知道
  • 如果用户说"微辣但不要太麻",程序听不懂

AI(美团/饿了么推荐算法):

# 没有写死任何推荐规则
推荐 = 模型(用户历史订单 + 当前关键词 + 附近餐厅 + 天气 + 时间)

🟢 优势:

  • 自己发现"你最近总点川菜"
  • 知道"下雨天你喜欢点热汤"
  • 能处理"不要太辣但要有味道"这种模糊需求

AI最牛的地方不是“记住答案”,而是:

📚 从经验中学习规律 → 🧠 建立认知模型 → 💡 应对未知情况

为什么AI具备思考、学习、决策的能力

AI的本质:AI = (数据 + 算法) × 算力 → 模型

AI就像做饭——数据是食材,算法是菜谱,算力是火候,模型是最后端出来的那盘菜。

1. 数据 —— 食材

通俗解释
数据就是AI学习用的“原材料”。就像你要做一道红烧肉,得有五花肉、酱油、糖——AI要学人脸识别,就得有大量的人脸照片。

业务视角

  • 数据越多越好:给AI看100张猫图,它可能认错;看100万张,它比猫还了解猫
  • 数据越准越好:如果给的图片里猫和狗混在一起,AI就学废了
  • 这就是为什么说“数据是生产力”:谁有高质量数据,谁就赢了第一步

业务同学常问:“我们公司有好多数据,是不是就能做AI了?”
回答:不一定。数据要清洗、标注、整理才能用。就像一堆带泥的萝卜,得洗干净切好了才能下锅。

2. 算法 —— 菜谱

通俗解释
算法是告诉AI“怎么学”的方法论。就像菜谱告诉你“先放油,再放肉,炒到变色加酱油”。

业务视角

  • 算法是核心竞争力:同样的数据,不同的算法,效果天差地别
  • 算法是人才和时间的沉淀:好的算法不是随便写出来的,是顶尖专家花很多年摸索出来的
  • 大部分公司不需要自研算法:就像你不用自己发明菜谱,用米其林大厨的就行(用开源的算法框架)

业务同学常问:“那我们要不要招很多算法博士?”
回答:看情况。如果你的业务很特殊(比如医疗影像),可能需要;如果做通用场景,用现成的就行。

3. 算力 —— 火候/火力

通俗解释
算力就是“计算的速度和能力”。就像做饭——煤气灶比柴火灶快,高压锅比普通锅快。

业务视角

  • 算力=时间:算力越强,AI学得越快。本来要训练一年的模型,用强大算力一个月搞定
  • 算力=规模:算力越强,能处理的模型越大(像GPT这种几千亿参数的怪兽,需要超强算力)
  • 算力很贵:训练大模型烧的钱,大部分都烧在电费和芯片上

业务同学常问:“那我们买多少服务器合适?”
回答:取决于你的数据量和模型大小。先小规模试,有效果再追加投入。算力是用钱换时间,想清楚你需不需要那么快。

4. 模型 —— 做好的菜

通俗解释
模型是AI“学完之后”的成果。就像你按照菜谱做好了一盘红烧肉——这就是模型。

业务视角

  • 模型=可用的AI能力:比如一个训练好的“客服模型”,能直接回答客户问题
  • 模型可以复用:做好一次,可以复制很多份用
  • 模型需要持续维护:就像菜放久了会馊,模型用久了会“过时”(数据变了,它就不好使了)

业务同学常问:“模型做好了是不是就一劳永逸?”
回答:不是。业务在变,用户在变,模型需要定期用新数据“再训练”或“微调”。

算法(秘方或者独家秘方,是听过不断试错沉淀下来的)是人才和时间的沉淀——确实,好的算法需要顶尖人才长期积累

数据本身就是生产力——确实,高质量数据是AI的燃料

芯片/算力是国与国竞争的底层逻辑——确实,算力已成为战略资源

AI的底层都是什么?

了解AI的本质之后,我们再看它的“地基”。英伟达CEO黄仁勋曾提出一个生动的“AI五层蛋糕”模型,清晰地揭示了从物理世界到应用价值的完整链条。

这是一张结构化的表格,描述了AI从底层物理基础到顶层应用价值的完整技术栈:

层级

核心要素

通俗解释

扮演的角色

五层:应用

药物研发、自动驾驶、法律助手、工业机器人等

AI创造经济价值的地方,真正被我们使用的产品和服务。

最终目的

四层:模型

大语言模型(如GPT)、蛋白质AI、物理仿真模型等

AI的“大脑”,经过训练后具备了理解和生成特定信息的能力。

智慧核心

三层:基础设施

AI工厂(数据中心)、土地、电力输送、冷却系统、网络

容纳和运行AI“大脑”的“身体和厂房”,提供物理空间、电力和网络。

运行环境

二层:芯片

GPU(图形处理器)、TPU(张量处理器)等AI专用芯片

AI的“心脏”,高效地将电能转化为计算能力,决定了AI的速度和成本。

算力心脏

一层:能源

电力

AI的“食物”。每一次AI的思考、每一次回答,都离不开电力的支持,是智能生产的根本瓶颈和约束。

根本动力

AI的分类

人工智能 (AI)
│
├── 机器学习 (机器学习)  ← 方法论基础
│   └── 深度学习 (深度学习)  ← 核心技术
│       ├── Transformer架构  ← 关键技术
│       └── 大模型 (基于Transformer的超大神经网络)
│           ├── 生成式AI (生成文本/图像/视频)  ← 能力
│           ├── 自然语言处理 (NLP)  ← 应用领域
│           ├── 计算机视觉 (CV)  ← 应用领域
│           └── 多模态 (融合NLP+CV等)  ← 前沿应用

AI、模型和产品的关系

一个核心比喻:AI是“食谱知识”,模型是“做好的菜”

我们可以用一个厨房的比喻来贯穿理解:

  1. AI (人工智能):是关于“如何做出美味食物”的全部知识和理论。它包括刀工、火候、调味原理、各种烹饪技巧。它定义了目标,提供了方法,是一个学科、一个概念
  2. 模型 (Model):是按照AI这个“食谱知识”,用具体“食材”(数据)和“烹饪方法”(算法)最终做出来的一道具体的“菜”。比如,一道“回锅肉”。这道菜就是“烹饪”这个抽象概念的具体实现和产物
  3. DeepSeek:是制作了“川菜”系列的一个特定“餐厅”(公司)。这家餐厅有自己的招牌菜,比如“DeepSeek-R1”就是他们做的一道拿手的“逻辑推理口味”的菜。而我们正在对话的DeepSeek(你正在使用的这个),就是这家餐厅最新推出的一道综合口味招牌菜

所以,链条是:
学科理论 (AI) → 指导制作方法 (算法/架构) → 产出一道具体菜 (模型) → 由某家餐厅出品 (DeepSeek公司)

什么是TOKEN

现在网上经常出现关于AI的Token。TOKEN到底是什么呢?

TOKEN是AI处理文字时的最小基本单位,就像我们写字的最小单位是“字”和“词”。

我们以DeepSeek为例,看这句话是如何拆分的:

我最爱吃苹果香蕉和橙子

AI会把它拆分成6个Token

序号

Token

说明

1

我最

高频词组,作为一个整体

2

爱吃

高频词组,作为一个整体

3

苹果

水果名称,作为一个整体

4

香蕉

水果名称,作为一个整体

5

单个字

6

橙子

水果名称,作为一个整体

AI把“我最”“爱吃”“苹果”“香蕉”“橙子”这种经常一起出现的词组当成一个Token,也是这个道理——一次计算就能输出,不用拆成单个字分两次算,节约了推理时间,提高了效率

AI给每一个TOKEN都会颁发一个身份证号码,DeepSeek的词汇表里一共有129280个Token。这就像水果店的“商品目录”,里面有129280种“商品”,每种都有自己唯一的货号(身份证号码一样)。

Token(文字)

Token编号(货号)

苹果

10001

香蕉

10002

橙子

10003

我最

20001

爱吃

20002

这就是Token的编码——简单说就是每个Token都有一个唯一的货号,AI通过这个编号快速找到对应的Token。
 

有了TOKEN之后,AI如何理解这个这个TOKEN呢?

例如:

“我爱吃苹果”,这里的苹果是指一种水果。

“我买了一部苹果手机”,这里的苹果是指一个品牌,而且苹果手机一般都代表高端,价格比较贵。等等可能在不同的语义下,“苹果”可能含义会区别很大。AI如何知道呢?

AI的解决方案:给每个Token编号配一份“详细档案”——这份档案就是向量

向量

向量就是“一个数值 + 一个方向”的组合,向量就是把“方向和大小打包在一起”的数学工具。例如:

开车

标量:车速表显示 80 km/h
只告诉你快慢,不告诉你去哪。

向量:导航说 “向东 80 km/h 行驶”
既有快慢,又有方向。如果只有速度没方向,你不知道自己是在往家开还是往悬崖开。

运动会

标量:跑了 100米(距离)
只算总长度,不管往哪跑。

向量:从起点 向东跑了100米(位移)
如果绕操场一圈回到起点,距离是400米,但位移是0(起点终点一样,方向抵消了)。

Token的“商品档案”——向量与维度

在DeepSeek里,每个Token的档案有7168个数字,也就是说维度是7168维

用“苹果”来理解向量

假设我们要描述“苹果”这个词的所有含义,可以用一组数字来表示它的不同特征:

水果属性

  • 甜度:8分
  • 酸度:4分
  • 水分:9分
  • 红色程度:8分
  • 圆形程度:9分
  • 脆度:7分
  • 可食用:1(是)

科技品牌属性

  • 手机相关度:9分
  • 电脑相关度:8分
  • 科技感:9分
  • 高端程度:8分
  • 乔布斯关联度:7分

文化属性

  • 平安象征:6分(“平平安安”)
  • 爱情象征:4分(“苹果”在西方文化中)
  • 成语出现频率:5分(“苹果脸”等)
  • 牛顿关联度:6分(“牛顿与苹果”)

...

把这些数字串在一起
[8, 4, 9, 8, 9, 7, 1, 9, 8, 9, 8, 7, 6, 4, 5, 6, ...] 一共7168个数字

这就是7168维向量——DeepSeek用7168个数字来描述“苹果”这个Token的全部特征。

也就说在DeepSeek中每一个TOKEN(例如:苹果),都会从7168不同的维度来描述“苹果”的特征。

为什么需要这么多维度?

如果只用3个数字(甜度、酸度、颜色),我们只能区分“苹果”和“香蕉”作为水果。

但如果“苹果”这个词出现在“我买了新苹果”这句话里,AI需要知道这里的“苹果”是手机,不是水果。这就需要额外的维度来记录“科技属性”。

如果“苹果”出现在“祝你平平安安”这句话里,AI需要知道这里的“苹果”是象征平安。这又需要额外的维度来记录“文化属性”。

维度越高,能表达的信息越丰富、越细致。 7168维让AI能够同时记录一个词在水果、科技、文化、商业、文学等各个领域的特征。

同一个词,在不同语境下,AI会激活不同的特征维度

  • 在“我爱吃苹果”中,AI激活水果相关的维度(甜度、酸度、水分等)
  • 在“我买了新苹果”中,AI激活科技相关的维度(手机、电脑、科技感等)
  • 在“祝你平平安安”中,AI激活文化相关的维度(平安象征、祝福等)

把两层结合起来

Token(文字)

Token编号(货号)

向量档案(7168个数字)

苹果

10001

[8,4,9,8,9,7,1,9,8,9,8,7,6,4,5,6,...]

香蕉

10002

[9,1,6,2,2,5,1,0,0,0,0,0,0,0,0,0,...]

橙子

10003

[7,6,8,3,1,6,1,0,0,0,0,0,0,0,0,0,...]

注意:香蕉和橙子作为水果,它们的“科技属性”“文化属性”维度数值很低(接近0),而“苹果”在这些维度上有较高的数值。

Token小结

第一层:商品的货号

  • 水果店里有129280种商品(129280个Token)
  • 每种商品都有一个唯一的货号(Token编号)

第二层:商品的多功能档案

  • 每种商品都有一份详细档案,档案里有7168个信息项
  • 比如“苹果”的档案:
    • 水果信息:甜度、酸度、水分、颜色、形状……
    • 科技信息:手机相关度、电脑相关度、科技感……
    • 文化信息:平安象征、爱情象征、成语频率……
    • 商业信息:品牌价值、市场占有率……
    • 还有几千个AI自己学到的、人类可能无法直接理解的特征
  • 这7168个信息项合在一起,就完整描述了“苹果”这个Token在各种场景下的全部特征

所以

  • Token编码 → 129280个Token,每个有唯一货号
  • Token含义 → 每个Token对应7168个数字的档案,描述它在各种场景下的特征

两者结合,AI才能根据上下文,激活正确的特征维度,准确理解语义。

AI为什么这么消耗算力?

AI处理一个问题的完整流程

第一步:输入拆Token
输入“我最爱吃苹果香蕉和橙子”。AI先拆成6个Token。

第二步:变向量
每个Token从词汇表里取出对应的7168维向量。6个Token → 6组×7168个数字。

第三步:加位置信息
AI还要给每个Token加上“位置编码”。因为“苹果和香蕉”与“香蕉和苹果”意思不同。位置编码就像给每种水果贴上序号标签,告诉AI谁在前谁在后。

第四步:并行计算
这时,AI把6组×7168个数字(一共约4.3万个数字)输入到模型里。模型有6700亿个参数(可以理解为AI模型的6700亿个小技能,例如:水果称重器:处理订单,算出苹果多重,价格计算器:处理订单,算出价格。是AI在训练过程中学习到的每一种技能,一共是6700亿个),让数亿个计算单元同时进行海量数学运算,计算每个Token之间的关联、语义、上下文……

打个比方:这就像让几亿个人同时做心算,每个人负责计算水果档案里的一小部分,最后汇总结果。计算量极其庞大。

第五步:预测输出
模型最终计算出词汇表里129280个Token中,下一个最可能出现的Token是什么,并按概率输出。比如算出来【和】概率最高,那就输出【和】。

第六步:循环直到结束
输出一个Token后,把它加回去,继续预测下一个,一个字一个字地输出,直到输出结束符。

为什么消耗算力巨大?

现在我们可以算一笔账:

概念

数量

比喻

向量(每次输入)

约4.3万个数字

顾客的订单

参数(固定)

6700亿个

店里的所有设备

每次计算量

4.3万 × 6700亿 ≈ 2.88 × 10^17次运算

所有设备处理一次订单

输出一个Token

算一次

处理一次订单

输出500字

算500次

处理500次订单

用水果店来理解

您店里有6700亿台设备。每次来一个顾客(输入一句话),您要把顾客的订单(4.3万个数字)发给每一台设备,让它们都处理一遍。

  • 水果称重器:处理订单,算出苹果多重
  • 甜度分析仪:处理订单,算出甜度
  • 价格计算器:处理订单,算出价格
  • ……6700亿台设备,每台都要处理一遍

处理完一遍,才能输出一个字

顾客要500个字的回答,您就得让这6700亿台设备重复工作500次

这就是为什么算力消耗巨大。

用数字说话

假设您输入100个字的提示词,AI输出500个字的回答。整个过程:

环节

数量

说明

输入Token

100个

您的问题

输出Token

500个

AI的回答

总循环次数

600次

每输出一个Token算一次

每次向量数字

约100个Token × 7168维 ≈ 72万个数字

输入+已输出的Token

每次计算量

72万 × 6700亿 ≈ 4.8 × 10^19次运算

天文数字

总计算量

600次 × 每次计算量

极端巨大

这就是为什么大模型需要几千张显卡同时工作,为什么算力成本这么高。

Token与成本

这直接关系到我们使用AI的成本。

绝大多数AI公司的收费模式,都是按照:

  • 输入的问题消耗的Token数
  • AI给出的答案消耗的Token数

两者相加,按总量收费。不是按字数算,是按Token数算。

用水果店来理解
水果店不是按“有几个水果”收费,而是按“水果拼盘的份数”收费。

  • 如果您点“苹果+香蕉+橙子”,这是一份水果拼盘(3个Token)
  • 如果您点“苹+果+香+蕉+橙+子”,这是六份水果拼盘(6个Token)

虽然都是三个水果,但拆得越碎,份数越多,收费越高。

所以,同样一段文字,不同AI的Token拆分规则不同,消耗的Token数可能不同,成本也会不同。

为什么在处理中文上,国内的大模型比国外大模型有优势,就是因为国内大模型在中文理解上(拆分TOKEN的能力上)是优于国外大模型的。

主流大模型参数一览(参考)

为了让您对“6700亿参数”有个直观感受,我整理了一下主流模型的参数规模:

模型

总参数

架构

激活参数

DeepSeek V3

6710亿

MoE

370亿

GPT-4

1.76万亿

MoE

约2800亿

Claude Opus 4.6

约5万亿

MoE(估)

未公开

Grok-3

约2.7万亿

MoE

未公开

Llama 3.1-405B

4050亿

稠密

4050亿(全部激活)

DeepSeek的优势:用6710亿总参数、370亿激活参数,就达到了接近Grok-3(2.7万亿总参数)的效果。说明我们的效率很高——用更少的算力达到同样的效果。

Transformer架构

  • 对过去:它终结了RNN、LSTM的时代,通过自注意力机制并行计算,解决了AI无法高效理解长序列数据和上下文的核心难题。
  • 对现在:它奠基了整个“大模型”时代。所有主流的大语言模型(如ChatGPT背后的GPT系列)和先进的文生图模型,都建立在Transformer架构之上。
  • 对将来:它统一了文本、图像、语音等不同领域,为实现多模态智能和探索通用人工智能提供了最关键的技术基石。

Transformer就是让AI能“一眼看全所有词,同时算出它们之间所有关系”的思考方式。
Transformer做了两件事:

编码器:理解用户意图(“顾客到底想要什么”)

解码器:根据理解生成答案(“配出水果拼盘”)

例如

顾客输入:“我要苹果、香蕉、橙子,多一点苹果,少一点香蕉”
                    ↓
【编码器】理解意图
    ↓
用注意力机制计算所有词的关系
    ↓
输出“内部工单”(数字形式的理解结果)
    ↓
【解码器】生成答案
    ↓
第1次循环:计算第一个字 → “好”
第2次循环:计算第二个字 → “的”
第3次循环:计算第三个字 → “我”
第4次循环:计算第四个字 → “放”
第5次循环:计算第五个字 → “苹果”
... 重复直到结束
    ↓
最终输出:“好的我放苹果3块香蕉1块橙子2块”

AI擅长什么,不擅长

场景类型

是否适合

原因

高容错、低风险(如文案草稿、客服初筛、代码补全)

✅ 适合

模型本质是概率输出,允许犯错

零容错、高风险(如医疗诊断、财务审批、法律判决)

⚠️ 谨慎

幻觉无法消除,必须有“人审核”或“规则兜底”

需要实时学习(如用户个性化推荐)

⚠️ 不适合纯大模型

模型权重不实时更新,需配合“检索+缓存”

需要精确计算(如预算核算、库存数量优化)

❌ 不适合

模型不擅长精确计算,应调用计算器/数据库

需要物理交互(如机器人操作)

❌ 不适合纯语言模型

需结合仿真、控制闭环,大模型只做“决策建议”

一句话应用

在企业立项时,你能直接判断——这个场景是“大模型擅长的概率任务”,还是“需要确定性系统兜底的关键任务”。

企业落地AI的前提是什么

前提一:战略层——业务场景必须“值得用AI”

这是最容易被跳过、却最重要的一步。

判断标准

条件

说明

反例(不适合)

场景明确

输入输出清晰,有明确边界

“用AI提升企业智能化水平”(太模糊)

价值可量化

能算清楚ROI:省多少钱、提多少效、增多少收

“提升用户体验”(无法衡量)

容错成本可控

AI犯错带来的损失可承受

医疗诊断、核电站控制

有“人审核”或“规则兜底”

关键决策不能完全交给AI

财务审批、合同签署

汽配行业举例

  • ✅ 适合:智能客服(答错了可以重答,最多损失一点用户体验)
  • ❌ 不适合:用AI直接判定“是否赔偿客户”(错了就是真金白银的损失)

前提二:数据层——数据必须“能用、够用、干净”

AI的本质是“用历史数据预测未来”。没有高质量数据,再好的模型也没用。

三个核心要求

要求

说明

检查清单

数据能用

与业务场景相关,覆盖主要情况

- 有历史数据吗?
- 数据字段与业务问题匹配吗?

数据够用

样本量足够训练或微调

- 分类任务:每类至少几百上千条
- 生成任务:几千到上万条高质量示例

数据干净

标注准确、格式统一、无偏见

- 数据有标注吗?标注准确率如何?
- 数据中有明显错误或缺失吗?

汽配行业举例

  • ✅ 数据就绪:有完整的VIN码库、配件编码库、历史工单记录
  • ❌ 数据问题:工单都是自由文本,没有结构化,质量参差不齐

没有数据怎么办?

  • 如果数据量小但场景明确:可以用“提示词工程 + RAG”不微调
  • 如果完全没有数据:先做数据采集,或选择“零样本”就能用的场景(如通用客服)

前提三:组织层——必须有“懂AI的人 + 懂业务的人”一起干

AI落地不是IT部门的事,是业务+技术+管理三方协同的事。

角色与职责

角色

职责

常见问题

业务方

定义场景、提供数据、验收效果

把AI当万能魔法,提不出明确需求

技术方

模型选型、工程实现、部署运维

只关心技术先进性,不关心业务价值

管理层

给预算、给耐心、推动协同

期望“上线就见效”,不理解迭代过程

失败项目的典型特征

  • 业务方说“你们做出来我用”,实际不参与
  • 技术方闭门造车,做出来业务方用不上
  • 管理层要求“三个月出成果”,不给迭代空间

成功模式

“业务+技术”组成联合项目组,业务出场景和数据,技术出方案和实现,共同对效果负责。


前提四:技术层——要有“选型能力”而非“自研能力”

很多企业误区:要么“必须自研大模型”,要么“完全不懂随便选一个”。

技术选型框架

场景类型

推荐方案

说明

通用对话、文档问答

调用API(DeepSeek、GPT等)

成本低、效果好,不需要自研

垂直领域、专有数据

RAG + 通用API

外挂知识库,不微调模型

特定任务、自有格式

微调小模型(如Llama、Qwen)

用自有数据优化,成本可控

核心业务、高频调用

私有化部署

数据安全、成本可控、可定制

关键能力

  • 不是“能不能训练模型”,而是“能不能判断用哪种方案”
  • 不是“参数多大”,而是“总成本多少、效果如何、数据安全怎么保障”

前提五:治理层——必须有“风险兜底机制”

AI不是软件,它的输出是概率性的。企业必须为“AI犯错”做好准备。

风险分级与应对

风险等级

场景示例

应对机制

(错了直接损失)

财务审批、合同审核、医疗建议

人审核、规则校验、AI只做辅助

(错了影响效率)

维修诊断、销售报价

人工确认、置信度标注、反馈闭环

(错了可重来)

客服问答、内部检索

允许自动,但保留人工介入入口

三条铁律

  1. 对外输出必须有人审核或规则校验
  2. 敏感数据(客户信息、价格)不能进公网API
  3. 建立“AI输出监控”机制——定期抽检、记录异常
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐