AI 是怎么回事??

拆解 AI 的黑箱:从人脸识别到人机协作,看懂 AI 的底层逻辑

        当手机能认出换了发型的你,当 ChatGPT 三秒内给出精准回答,当 AI 能写代码、过律师考试却又会一本正经地撒谎,我们总会忍不住好奇:AI 到底是怎么工作的?它看似无所不能,却又处处受限,其背后的底层逻辑,从来都不是 “拥有了人类的智能”,而是一套被反复训练的模式匹配体系。博主 “我没有三颗心脏” 的《AI 是怎么回事》系列,用 16 篇探索笔记拆透了 AI 的黑箱,从基础原理到实战应用,从能力边界到人机协作,让我们看清了这个 “超级模式匹配器” 的本质 —— 它不懂孤独,不懂业务,不懂真正的创造,却能在既定规则里,把效率发挥到极致。

        AI 的 “聪明”,从手机人脸识别开始就有迹可循。这是我们最贴近 AI 的日常,哪怕改变发型、化了淡妆,手机依然能精准解锁,核心在于 AI 对人脸特征的海量提取与匹配。它不会像人类一样 “看脸识人”,而是把人脸拆解成无数个特征点,通过神经网络中数千万个 “旋钮” 的调节,将新的面部特征与数据库中的样本做比对,匹配度达到阈值,便完成了识别。这也是 AI 所有能力的起点:基于海量数据,在明确的模式中找到规律,再将规律应用到相似场景中。而 2012 年,正是 AI 发展的关键节点,彼时的技术突破让 AI 的模式匹配能力实现了质的飞跃,让外界直呼 “像是作弊了”,也为后续 ChatGPT、AI 绘画、AI 编程的爆发埋下了伏笔。

        如果说人脸识别是 AI 视觉领域的入门级应用,那自然语言处理则是其模式匹配能力的进阶体现。AI 能 “读懂” 文字,靠的不是理解语义,而是对语言规律的深度挖掘,就像 “国王” 减去 “男人” 等于 “女王” 的趣味运算,AI 并非知晓词汇背后的身份含义,而是从海量文本中学习到了词汇间的关联规律。ChatGPT 能实现流畅对话,背后是一篇被引用 17 万次的论文奠定的技术基础,它在三秒钟的回答时间里,始终在做一件事:根据上下文的语言模式,预测下一个最可能出现的词汇,再将词汇串联成句。这种 “续写式” 的对话逻辑,让它能模拟人类的交流方式,却也让它天生带有 “撒谎” 的基因 —— 当训练数据中没有对应的模式,或是上下文信息不足时,它会为了完成 “续写”,编造看似合理却毫无依据的内容,就像那位被 ChatGPT 欺骗的律师,看似专业的法律依据,不过是 AI 的无中生有。

        在不断解锁新能力的过程中,AI 的 “能力分界线” 也愈发清晰:它能赢世界冠军,却开不好车;能画出惊艳的画作,却不懂创作的灵感;能通过律师考试,却不懂法律背后的人文温度。究其根本,是因为棋牌、绘画、考试这类场景,都有明确的规则和海量的训练数据,是模式匹配的完美赛场;而自动驾驶需要应对复杂多变的现实路况,创作需要情感与思想的支撑,法律实践需要结合具体的人情世故,这些场景没有固定的模式,需要对上下文的全局理解,更需要主观的判断与取舍,而这,正是 AI 的短板。哪怕是 AI 看似最擅长的创造领域,从一团噪声到一幅惊艳的画作,其本质也只是对海量图像特征的重组与匹配,而非真正的原创,它能复刻风格,却造不出独属于人类的情感与思考。

        当 AI 的能力渗透到工作与生活,如何与 AI 协作,成为了我们必须学会的课题。AI 写代码的表现,正是人机协作的最佳缩影:它能让编程效率提升 55%,平均贡献近一半的代码,甚至让非程序员也能通过日常语言搭建应用,却也会让代码的逻辑错误增加 75%,在大型项目中因上下文窗口的限制频频 “迷路”。这背后的核心,是 AI 始终无法突破 “模式匹配” 的局限 —— 它能写规整的样板代码、修常见的 bug、做快速的原型开发,却不懂业务逻辑的核心,不会做架构设计,更无法完成精准的代码审查与性能优化。所以与 AI 协作的关键,从来不是盲目信任,而是明确分工:把模式明确、数据充足、结果可验证的工作交给 AI,把需要理解、判断、决策、创造的工作留给人类。要让 AI 听懂你的话,要让 AI 的能力为我所用,前提是我们自己先想清楚目标与需求,否则,AI 的输出只会是无的放矢。

        我们总会问:AI 会取代我们吗?这个问题的答案,藏在 AI 的本质里。它能取代敲代码、记语法、做重复数据处理的机械性工作,却取代不了人类的思考、判断、情感与创造。就像电子表格的普及没有消灭会计行业,反而让会计师从手工记账转向更有价值的财务分析;AI 编程的发展也不会让程序员失业,而是让 “只会写代码” 的入门级岗位收缩,让能驾驭 AI、做系统设计、懂业务逻辑的开发者更具竞争力。AI 降低了很多领域的入门门槛,让普通人也能接触到编程、设计等曾经的专业领域,却从未降低任何领域的天花板 —— 真正的核心能力,永远是人类独有的逻辑思考、全局视野与创新思维。

        AI 不懂 “孤独” 是什么意思,不懂 “感动” 是什么感受,不懂 “思考” 是什么过程,它只是一个被人类训练出来的工具,一个极致的模式匹配器。拆解 AI 的黑箱,看懂它的底层逻辑,不是为了畏惧它的能力,而是为了更好地驾驭它。在 AI 时代,最核心的竞争力从来不是与 AI 比拼模式匹配的效率,而是守住人类独有的、无法被算法替代的那些能力 —— 理解、判断、创造、共情。让 AI 做它擅长的事,让人类做自己擅长的事,人机协作的本质,从来都是让技术成为人类的延伸,而非替代。

AI 会取代我们吗?
AI 永远替代不了人类

        因为它只懂模式匹配,不懂真正的理解和感受,就连 “孤独” 这种情绪,它能写得天花乱坠,却压根不知道是什么意思

核心认知:AI 会写 “孤独”,但真的不懂孤独

让 ChatGPT 写孤独的文字,它能写得特别动人,但这只是它的 “文字游戏”:它在海量训练数据里,找到 “孤独” 和 “深夜空房间”“人群中无人对视” 这些词的高频搭配,按统计规律拼接出优美句子,就像按规则拼积木,不是真的体会过孤独。这就像一个不懂中文的外国人,靠一本规则手册跟中国人聊天,外人看他聊得很溜,其实他只是机械操作符号 ——ChatGPT 就是个超大号的 “规则手册玩家”,所有回答都是计算出来的,没有任何感受和理解。

回答 “会不会被取代”,先搞懂 AI 的本质:它只是个 “超级模式匹配器”

回顾整个系列的核心结论,AI 的所有能力都基于一个底层逻辑:在海量数据里找统计规律,匹配相似模式,再套用输出。它能识人、写代码、过考试,都是因为这些事有明确的规则和大量数据;但它开不好车、不懂业务、不会共情,是因为这些事没有固定模式,需要真正的理解和判断。带着这个本质,分三个问题把 “取代” 这件事说透:

1. AI 会取代哪些工作?—— 只取代 “纯模式化” 的工作环节,不是整份工作

简单说,重复、机械、有固定规则的事,AI 会做得又快又好;需要思考、判断、创造、共情的事,AI 完全做不了。比如文员整理数据、客服套模板应答、记账员算账目,这些纯模式匹配的工作会被 AI 取代;但 STEM 研究、医生诊断、心理咨询、设计师原创,这些需要理解和判断的工作,不仅不会被取代,反而会更值钱。大多数人的工作不会消失,只会被 “重塑”:AI 接手重复的部分,人把更多精力放在需要思考的核心部分。

2. AI 以后会不会 “真的” 理解世界?—— 短期没戏,底层原理没突破

现在的 AI 只会 “匹配见过的模式”,不知道模式背后的原因:它知道苹果松手会掉,不是理解了重力,只是数据里 “苹果” 和 “掉落” 总一起出现;它没有身体,没法感知冷、热、疼,而人类的理解全靠身体和生活经验。学术界想让 AI 真正理解世界,还有两个难题没攻克,目前都还在研究阶段,没人知道啥时候能成;就算专家预测 “通用人工智能(AGI)” 的到来时间,分歧也超大,有人说 2026 年,有人说要几十年,而且他们说的 “AGI”,大多只是 “能通过所有人类考试的 AI”,不是 “真的懂世界的 AI”。

3. AI 会不会有意识?—— 目前肯定没有,未来也没法判断

连科学家都没搞明白人类的意识是怎么来的,更没法判断 AI 有没有意识。现在的 AI 本质就是一堆乘法和加法运算,靠 1750 亿个参数做计算,这些冰冷的数学运算,目前来看根本生不出意识。那些让你觉得 “AI 好像有意识” 的对话,只是它训练出来的 “表演”,就像演员演愤怒,不是真的愤怒;科技公司说 AI 有情感,更多是营销手段,不是科学事实。

一个超有意思的观点:AI 是一面镜子,照出了人类真正的价值

AI 做不到的事,恰恰定义了 “人之所以是人”:它能做高速计算、模式匹配、统计预测,但不会定义问题(我们该解决什么)、做价值判断(这样做对不对)、建立信任(我相信你)、创造意义(这件事为什么重要)、共情(我理解你的感受)。这些能力其实一直都很重要,只是以前被大量重复工作淹没了;AI 接管了重复工作,反而让这些人类独有的能力,成了核心竞争力。

AI 时代,学什么才不会过时?—— 不学工具技巧,学底层框架

别去学 “某个 AI 工具的使用方法”,比如 Midjourney 的技巧、ChatGPT 的指令,这些工具更新太快,学了很快就没用;要学 AI 的底层原理和判断框架,这是永远不会过时的。比如知道 “AI 过考试只是模式匹配,不是真懂”,知道用 “三问判断法”(模式明确吗?数据够吗?能验证吗?)判断 AI 能不能做一件事,知道区分 AI 的 “规模突破”(更大模型、更多数据)和 “原理突破”(真正的新架构)。有了这套框架,不管以后出什么新 AI,你都能看清它的本质,不会被炒作带偏。

总结

  1. AI 不是魔法,只是统计学和工程学的胜利,所有能力都是数据和计算的结果,没有真正的智能;
  2. AI 不会取代人类,只会重塑工作,接管模式化环节,让人类的思考、创造、共情能力更重要;
  3. 研究 AI 的过程,其实是重新认识自己的过程:我们发现自己的核心价值,从来不是会做重复的事,而是会理解、会感受、会创造意义。

哪怕 AI 能写出千万种关于孤独的文字,它也永远不会体会到,凌晨三点醒来盯着天花板,心里空落落的那种感觉 —— 这种独属于人类的生命体验,藏在我们的感受里,不在 AI 的参数和数据里,这就是人类永远无法被取代的原因。

关于AI 写代码的那些事儿

AI 写代码确实快,但毛病也多,没法完全替代人,关键得搞懂怎么和它配合着用,用大白话把核心内容捋清楚:

为啥 AI 特别会写代码?

因为写代码这事,刚好踩中了 AI 的 “强项密码”,三个条件全满足:

  1. 规则特清晰:编程有固定语法,比如 if 后面必须跟条件,不像人类说话模棱两可,AI 这种 “模式匹配高手” 最擅长搞这种有规矩的事;
  2. 学的资料贼多:网上有海量公开代码,光 GitHub 就有 5 亿多个代码仓库,AI 见过的代码模式,比任何程序员这辈子见过的都多;
  3. 对错一眼能看出来:代码能不能跑,点一下就知道,不像写文章没统一标准,AI 的输出能立刻验证,错了就改。也正因如此,AI 编程工具火得不行,比如 GitHub Copilot 有 1500 多万付费用户,Cursor 编辑器两年就估值 90 亿美元。

再看,AI 写代码到底有多牛?还真颠覆了不少认知

现在甚至出了个叫VibeCoding(氛围编程) 的新方式:不用写代码,用大白话跟 AI 说需求,它就给你写,哪怕看不懂代码,看结果就行。

  • 大佬都这么用:OpenAI 的 Karpathy 直接用语音跟 AI 说 “把侧边栏间距减半”,连键盘都不碰,AI 改的代码他看都不看,报错了把信息丢给 AI,基本都能修;
  • 普通人也能上手:菲律宾一位完全不懂编程的女士,用 AI 的功能,靠日常说话就给社区做了个资源共享的小程序;硅谷不少创业公司,四分之一的代码都是 AI 写的;
  • 效率是真的高:有研究显示,用 AI 写代码的开发者,做同样的事比不用的快55%,AI 平均能写近一半的代码,而且 88% 的代码都能直接用。

但别被惊艳到,AI 写代码的坑,一点都不少!

标题里说的 **“错多了 75%”** 是关键,AI 只适合做小项目,一到真实的复杂工作,毛病全出来了,主要三个大问题:

  1. 代码能跑,但逻辑全错:AI 写的代码,表面看能运行,实际藏着很多逻辑问题,这类错误比人类写的多 75%。比如让它做记账工具,它会用普通小数算金额,结果会有精度误差,而懂行的程序员都会用整数算(按分算),因为 AI 只懂匹配 “数字相加” 的常见写法,不懂记账的业务要求;
  2. 压根不懂你的真实需求:65% 的程序员都吐槽,AI 缺 “上下文”,不知道你的项目整体是啥样、业务规则是啥。比如你让它改代码,它可能改得能跑,但根本不是你想要的效果,这种错比 AI 瞎编代码更隐蔽,难发现;
  3. 项目一大,AI 就 “迷路”:AI 有 “上下文窗口” 限制,一次只能看有限的代码,小项目(几个文件)能看清全貌,大项目(几十个文件、几万行代码)就顾此失彼,比如在 A 文件把日期写成 “2025-01-15”,在 B 文件又写成 “01/15/2025”,前后矛盾导致程序出错。

甚至有个实验特打脸:让资深程序员用 AI 做大型真实项目,结果实际效率反而慢了 19%,程序员自己还觉得快了 20%—— 因为敲代码的动作快了,但后续要花大量时间检查、调试 AI 写的错代码,隐性成本把速度优势全抵消了。

划重点:AI 和人,到底该怎么分工写代码?

简单说:死板、重复、能验证的活交给 AI,需要思考、判断、懂业务的活,必须人来做。✅ 适合让 AI 干的事

  • 快速做原型:有个想法想试试,让 AI 做个粗糙版本,能跑就行,能省 50%-70% 的时间;
  • 学新编程知识:让 AI 用新语言写个功能示例,比翻文档快多了;
  • 写重复代码:比如数据库连接、配置文件这些固定模板,AI 写了人检查就行;
  • 修 bug、看报错:把看不懂的报错信息丢给 AI,它见过无数类似情况,能快速找原因。

必须人来干的事

  • 设计项目架构:比如项目分几个模块、数据怎么流转,需要懂整体需求,AI 没这能力;
  • 判断业务逻辑:比如 “用户删号后历史数据留多久”,这是业务问题,不是代码问题,AI 不懂;
  • 审查代码:AI 写的代码安全漏洞是人类的 1.5 倍,96.2% 的程序员都认为,AI 代码必须人审才能用;
  • 优化代码性能:AI 只保证代码能跑,不会考虑效率,比如它写的代码读写数据的操作会比人类多 8 倍,人得懂计算机底层才能优化。

大家最关心的两个问题,答案很明确

1. 程序员会失业吗?—— 不会,但岗位会 “洗牌”
  • 长期看,程序员需求还会涨:美国预测到 2033 年,软件开发岗位会增 17%,因为 AI 提高效率后,软件开发成本变低,企业做软件的需求会更多,而且 AI 工具本身也需要程序员开发、维护;
  • 短期看,入门级岗位会减少:只会机械敲代码的程序员会被淘汰,而能驾驭 AI、做架构设计、懂业务的程序员,会更吃香。就像当年 Excel 普及,淘汰了手工记账的簿记员,但会计行业反而更火,因为会计师从 “算数” 转向了更有价值的 “分析决策”,AI 编程也是一个道理。
2. 现在还该不该学编程?—— 该,但学习重点变了
  • 利好:AI 把编程的语法门槛降没了,不用死记硬背 for 循环、函数怎么写,AI 全能干,普通人也能靠大白话做编程相关的事;
  • 关键:编程的核心难点,从 “记语法” 变成了练逻辑。比如想清楚 “这个功能该怎么设计”“循环为什么要跑 10 次”“不同功能怎么配合”,这些 AI 帮不了,全靠人思考。简单说,AI 让编程入门更容易了,但想做好,要求反而更高了,逻辑思考能力才是核心。

        你要开发一个新项目,老板要开新业务,产品经理先出个产品文档。在 SDD 规范里,这叫 spec.md。它只聚焦用户价值和业务意图,不聊技术,只聊“我们要干什么”。

有了产品文档,研发得定框架、写技术文档。在 SDD 规范中,这叫 plan.md。

有了技术文档,接下来就是搬砖了。以前是我们人来写代码,现在交给 AI,得先让它把要做的事写成任务列表,这在 SDD 规范中叫 tasks.md。

最后确认 tasks.md 没有问题,就要开始开发了。但是开发过程中,一般技术人都有自己的团队规范,例如变量命名规范是什么,代码接口规范是什么等等。

这种全局性的“游戏规则”,在 SDD 规范中交 constitution.md。

其实本质就是不断拆解你的需求,最后对齐 ai 到底帮我们做哪些任务

“意图接管”:把报错丢给 AI,直到没有错误为止。

AI 不是全自动开发工具,而是高级辅助工具。想要保证代码质量,必须遵守两条铁律:

1. 测试用例必须全覆盖

AI 写测试用例的速度还是挺快的,而且准确性很高,所以可以借助单元测试、集成测试、接口测试来完成对 AI 功能的初次校验。

2. 必须有资深开发者逐次审查

没有人能跳过「理解代码」这一步。例如对代码:

  • 审查逻辑合理性
  • 审查架构规范
  • 审查性能隐患
  • ...

100% Vibe Coding = 技术裸奔 ------ 

真正高效的模式是:Human Intention + AI Execution + Human Review

总结

AI 写代码,快了 55% 但错多了 75%,它只是个 “超级模式匹配器”,能把死板的代码工作自动化,但永远不懂真正的业务和逻辑。和 AI 配合写代码的关键,是人先想清楚要做什么,再让 AI 干具体的活,AI 是超强助手,不是替代人的专家。而编程的本质,从来不是写代码语法,而是想清楚 “要做什么、为什么这么做”。      人类意图 +人工智能执行 +人类审核

别再吹牛了,100% Vibe Coding 存在无法自洽的逻辑漏洞! - ai超级个体 - 博客园

                                        怎么跟 AI 协作

一、AI 怎么 "读懂" 文字?

核心主题:拆解 AI 处理文字的底层逻辑,解答 AI 如何将文字转化为可计算的数字并实现语义 “理解”。

核心知识点

  1. AI 的文字基础认知:电脑 / AI 本身不认识文字,仅能识别符号,处理文字的第一步是将文字数字化,且数字化需体现文字的语义关系。
  2. Token:AI 处理文字的最小单位
    • 定义:AI 不会逐字 / 逐句读文字,而是将文字切分为 Token(可单字、单词、半个词),是 AI 处理文字的 “一口”。
    • 分词方法:采用 BPE 字节对编码,常见组合保持完整,生僻词拆为常见碎片,让 AI 用少量碎片拼出所有文字(如 GPT-4 约 10 万个 Token)。
    • 实用换算:英文约 4 字母 = 1Token,中文约 1-2 汉字 = 1Token,GPT-4 上下文窗口 128000Token≈6-10 万中文字。
  3. 词向量:给文字赋予 “语义数字”
    • 定义:将每个 Token 转化为一串有序数字(向量),用数字编码文字含义,真实模型中多为 300/768 维,维度无明确人工标签,由 AI 从数据中自学。
    • 核心特性:数字间的关系体现语义关系,经典案例为向量 (国王)- 向量 (男人)+ 向量 (女人)≈向量 (王后),能自动编码性别、首都、比较级等语言逻辑。
    • 训练逻辑:基于 “词随文走”,经常出现在相似上下文的词,词向量更接近;反之则更远,重复几十亿次训练实现。
  4. 余弦相似度:判断文字语义相似度
    • 原理:不比较词向量的数字大小,而是比较向量方向,夹角越小、余弦值越接近 1,语义越相似。
    • 应用:是 AI 判断 “猫和狗更像,猫和键盘不像” 的核心方法,也是语义搜索的基础。
  5. AI 处理文字的完整流程:文字→切分 Token→转化为词向量→对数字做数学运算→实现语义 “理解”。

关键结论

  1. AI 眼中没有文字,只有高维空间里的点,词向量是文字的数字化载体,维度越多能捕捉的语义细节越丰富。
  2. AI 的 “读懂” 并非人类式的理解,而是通过计算词向量的距离和关系实现语义匹配,无人教它语言规则,而是从海量文本中自学出语言结构。
  3. 词向量是所有现代 AI 语言模型的基础,实现了从 “字面匹配” 到 “语义理解” 的跨越,让 ChatGPT、语义搜索成为可能。

二、AI 到底有多聪明?—— 一份让 AI 研究者也困惑的成绩单(

核心主题:通过 AI 的能力矛盾现象,拆解 AI 智能的本质,解答 “AI 到底聪不聪明” 的核心问题。

核心知识点

  1. AI 的能力矛盾现象
    • 强能力:GPT-4 能通过律师考试(前 10%)、SAT 总分前 5%、GRE 语文 99 百分位;2026 年新模型能拿下数学竞赛满分、研究生级科学题超越人类专家。
    • 弱能力:同一模型会算错 9.11>9.8 的小数比较、四位数乘法错误率超 70%;2026 年模型抽象推理测试不如人类、事实问答幻觉率最高达 48%。
  2. 人类与 AI 的智能本质差异
    • 人类智能:存在 “g 因子”,认知能力呈整体性,语言、逻辑、计算能力相互关联,擅长一项则其他项通常不差。
    • AI 智能:碎片化智能,无统一 “聪明度”,不同任务的能力相互独立,取决于该任务的训练数据覆盖度任务结构,强领域可超人类,弱领域不如小学生。
  3. 能力矛盾的底层原因拆解
    • 能过律师考试:法律考试以选择题为主,问答模式在训练数据中大量存在,AI 仅做模式匹配,并非 “懂法律”;但论述题表现差(仅前 15%),因需要因果推理而非单纯模式识别。
    • 算错小数比较:一是 AI 未做 “计算”,只是预测下一个词,小数比较的训练数据覆盖不足;二是 Token 化破坏数字数学关系,AI 将数字视为文字碎片而非数值(如把 9.11 拆为 9 和 11,误判 11>8)。
    • 说话像靠谱的人:并非 AI 变聪明,而是经过RLHF 人类反馈强化学习,分为监督微调、训练奖励模型、强化学习三步,让 AI 学会生成 “人类觉得有用、切题、礼貌” 的回答,未改变其模式匹配的底层逻辑。
  4. 2026 年 AI 研究的新困惑
    • 推理模型悖论:专门优化的推理模型(如 o3)在数学 / 编程上表现惊人,但事实幻觉率更高(33%),推理链越长越易编造信息。
    • 评测工具失效:传统基准测试(如 MMLU)被 AI 打穿,研究者不断设计更难测试,但新测试发现 AI系统性高估自身正确率(校准误差 34%-89%)。

关键结论

  1. “AI 有多聪明” 是错误问题,正确问题是 “AI 在这个具体任务上有多强?为什么?”,AI 的能力由任务的训练数据和结构决定,而非统一的智能水平。
  2. AI 的所有能力均源于模式匹配,无真正的推理、理解能力,所谓 “推理” 只是更高级的模式匹配,换数字、加无关条件就会出错。
  3. RLHF 和推理训练仅让 AI 学会 “好好说话” 和 “好好思考的样子”,未教会 AI 什么是事实,幻觉是其底层架构的固有问题。

三、AI 能创造吗 —— 从一团噪声到一幅画

核心主题:拆解 AI 绘画的底层技术原理,解答 “只会模式匹配的 AI,为何能生成从未存在的图片” 的问题,验证 “AI 是超级模式匹配器” 的核心结论。

核心知识点

  1. AI 眼中的图片:与文字同理,图片在 AI 眼中是一堆数字(如 512x512 彩色图 = 78 万个 0-255 的数字),AI 绘画并非 “从无到有画”,而是从噪声中还原图片
  2. 扩散模型:AI 绘画的核心技术
    • 核心逻辑:分为前向扩散反向扩散(去噪),前向扩散是给清晰图片逐步加噪声至纯雪花屏(无需 AI);反向扩散是 AI 学会从带噪图片中预测噪声并减掉,让图片逐步清晰。
    • 训练逻辑:用几百万张图片反复训练,让 AI 看带噪图片猜噪声,根据猜的结果调整参数,最终学会精准预测任意图片的噪声。
  3. CLIP:文字指导绘画的 “桥梁”
    • 训练逻辑:用 4 亿对图文数据训练,生成图片编码器和文字编码器,将图片、文字均转化为 512 维向量,让配对的图文向量在数学空间中靠近,建立文字和视觉的关联。
    • 工作逻辑:输入文字后,CLIP 将其转化为文字向量,扩散模型每一步去噪都参考该向量,往文字描述的视觉模式方向去噪,让噪声逐步变成符合文字的图片。
  4. VAE:提升 AI 绘画效率的关键优化
    • 问题:直接在高清像素上去噪计算量巨大,速度慢。
    • 解法:将高清图片压缩为 64x64 的缩略潜在空间,在潜在空间去噪(速度快几十倍),再解压回高清图,这也是 Stable Diffusion 被称为 “潜在扩散模型” 的原因。
  5. AI 画不好手指的三大原因
    • 训练数据中手指模式不稳定:手指姿势多样、占画面比例小、易遮挡,无固定统计模式;而人脸模式固定,AI 易学习。
    • AI 无三维结构概念:扩散模型是二维图像生成器,仅处理数字,不知道 “手有 5 根手指” 的常识。
    • 人类对手的容错率极低:手指多一根 / 少一根会立刻被察觉,而人脸的细微差异易被忽略。

关键结论

  1. AI 绘画并非 “创造”,而是从噪声中还原统计模式,与 ChatGPT 续写文字的本质一致 —— 都是在训练数据中学到统计模式,再进行新组合。
  2. AI 生成的新图片,是将训练数据中的视觉统计规律(如眼睛在脸的上半部分、天空在上方)注入噪声,并非原创,只是未复制任何一张训练图。
  3. “AI 是超级模式匹配器” 的核心结论再次验证,该模型能解释 AI 的语言、视觉等所有能力,AI 的 “创造” 只是统计模式的新组合,无真正的创意和想象。

四、怎么让 AI 听懂你的话?—— 同一个 AI,为什么他用得比你好 10 倍

核心主题:从原理层面拆解 Prompt 提示词的核心逻辑,给出 4 种让 AI 精准理解需求的实用技巧,打破 “Prompt 是玄学” 的认知。

核心知识点

  1. Prompt 的核心本质:Prompt 就是给 AI 的上下文,AI 的输出质量由上下文质量决定,核心公式为:更多上下文 = 更窄的概率分布 = 更精准的输出
    • 差的 Prompt:上下文少,AI 的注意力机制无法对焦,只能输出所有模式的 “平均值”(如仅说 “写一封邮件”,输出万能模板)。
    • 好的 Prompt:上下文丰富,AI 的概率分布急剧收窄,注意力精准对焦,输出贴合需求的内容(如指定身份、读者、语气、长度)。
  2. 4 种核心 Prompt 技巧(均为缩窄 AI 的概率分布)
    技巧 核心做法 底层逻辑 适用场景
    给上下文 明确读者、目的、风格、长度、约束等 直接缩窄,给注意力机制更多对焦锚点 几乎所有场景
    给例子 提供 2-5 个 “输入→输出” 的样本(Few-shot) 利用 AI 的模式匹配能力,让其提取样本模式并应用 需要特定格式、风格、结构的任务
    分步思考 让 AI 展示中间推理步骤(思维链 CoT) 拆分缩窄,把大问题拆为小步骤,每一步输出成为下一步的上下文 多步推理任务(数学、逻辑、复杂问题)
    角色设定 给 AI 设定专业身份(如资深 HR、律师) 偏移缩窄,让输出概率分布偏向该领域的文本模式 需要特定领域表达风格的任务
  3. 技巧的关键注意点
    • 给上下文:要有效上下文,避免无关信息(会分散注意力,降低输出质量),每句话都要缩窄概率分布。
    • 给例子:模型越大,Few-shot 效果越好,GPT-3 等大模型能从少量样本中精准提取模式。
    • 分步思考:仅在大模型(参数量≥1000 亿)上有效,能让数学题准确率从 17.9% 提升至 56.9%。
    • 角色设定:仅调整文本风格,无法提升事实准确性,对事实类问题几乎无效。
  4. Prompt 的边界
    • 若任务本身无法通过模式匹配解决(如证明黎曼假设、创造全新数学理论),再好的 Prompt 也无用。
    • AI 的实时信息能力(如查天气)并非 Prompt 的功劳,而是模型外接了搜索管道,Prompt 仅能优化模型内部的概率分布。

关键结论

  1. Prompt Engineering 不是玄学,而是利用 AI 的模式匹配特性,所有技巧的本质都是给 AI 提供更精准的上下文,缩窄其概率分布。
  2. 无需背万能 Prompt 模板,理解原理后,只需问自己:AI 缺什么信息?我需要告诉它什么才能让它给出想要的结果?
  3. 即使 AI 越来越智能,能自动推测上下文,主动提供丰富、精准的上下文仍会带来更好的输出,原理永远比模板重要。

五、怎么跟 AI 协作不翻车?——AI 说的话,你该信几分

核心主题:基于 AI 的底层原理,给出 4 条有理论支撑的 AI 协作黄金原则,解答 “AI 的话该信几分”“如何高效避坑与人机协作” 的问题。

核心知识点

  1. AI 的正确定位:把 AI 当作能力超强但完全不靠谱的实习生—— 读过海量数据,干活速度比人快 10 倍,但会一本正经编造事实,且出错时比说真话更自信。
    • 极端误区 1:把 AI 当神谕,盲信其输出(如律师用 AI 写文书,引用 6 个虚假判例被罚款)。
    • 极端误区 2:把 AI 当玩具,完全不用(如开发者不用 AI,效率比他人低 55.8%)。
  2. 4 条 AI 协作黄金原则(基于 AI 的模式匹配本质)
    原则一:让 AI 做它擅长的事
    • 判断标准:用 “三问判断法”—— 能转化为模式匹配吗?训练数据够吗?能验证输出吗?
    • AI 擅长(模式匹配型任务):初稿生成、信息整理、代码框架、翻译改写、头脑风暴。
    • AI 不擅长(理解型任务):事实核查、关键决策(医疗 / 法律 / 投资)、价值观判断、最终审核、承担责任。
    • 底层原因:AI 是超级模式匹配器,无法理解具体情境的独特性,仅能匹配已有数据的模式。
    原则二:验证 > 信任
    • AI 幻觉的严重性:通用领域幻觉率约 0.7%,但专业领域(法律 / 医疗)达 17%-33%;推理模型幻觉率更高,且 AI 出错时更自信。
    • 真实后果:律师因虚假引用被罚款、患者因 AI 诊断延误病情、学术论文出现虚假参考文献。
    • 底层原因:AI 的优化目标是预测下一个最可能的词,而非 “最准确的词”,且被训练为 “永远给答案”,不会说 “不知道”。
    • 实操方法:把 AI 输出全当初稿,核实关键数据、引用来源、代码逻辑,按风险等级验证(高风险内容重点核查)。
    原则三:迭代,而非一次到位
    • 核心问题:AI 第一次回答的上下文最少,输出质量最差,直接用 / 直接扔都是浪费。
    • 底层原因:每一次反馈都是给 AI新的上下文,让其概率分布进一步缩窄,就像调收音机,每一次微调都让信号更清晰。
    • 推荐工作流:给清晰需求→拿初稿→审查提具体反馈→拿改进版→微调细节→最终定稿(2-3 轮迭代即可出高质量结果)。
    • 关键认知:AI 迭代速度极快(几秒一版),迭代总时间比自己从零开始做更短。
    原则四:用 AI 放大你的优势,而非替代你的思考
    • 类比:计算器普及未消灭数学思维,只是替代了计算动作;AI 替代执行(写文字、敲代码),但无法替代思考(定义问题、判断质量、做决策)。
    • 人机分工:人负责定义问题、判断质量、做决策、承担责任;AI 负责生成初稿、处理重复、探索可能性、加速执行。
    • 风险警惕:自动化偏见—— 人类天然过度信任 AI,即使 AI 出错,80% 新手、50% 老手会跟着错,可解释 AI 甚至会加剧该偏见。
  3. AI 协作完整案例(写项目提案)
    1. 人定义需求(原则四):明确说服对象、核心论点、约束条件;
    2. AI 生成初稿(原则一):按需求生成结构完整的提案;
    3. 人审查反馈(原则二 + 三):核实数据、检查逻辑,给出具体修改意见;
    4. 迭代优化(原则三):AI 按反馈修改,2-3 轮后由人最终润色定稿。
  4. 读者高频问题解答
    • AI 以后会变得完全可信吗?:短期内不会,幻觉是 AI 架构的固有特性,数学上已证明无法通过更多训练消除,“接近零幻觉”≠“零幻觉”。
    • 怎么知道 AI 输出哪里错?:按风险等级核查;重点关注数字 / 日期、人名 / 机构、引用、因果论证、冷门专业细节;交叉验证;警惕 AI 的 “过度自信”。

关键结论

  1. 用好 AI 的关键不是掌握多少技巧,而是理解其本质—— 知道什么时候用、什么时候信、什么时候盯,信任和怀疑之间的边界由 4 条原则界定。
  2. 人机协作的正确姿势:各自做最擅长的事,AI 接管重复性执行工作,人类把精力放在需要理解、判断、创造、承担责任的核心工作上。
  3. 验证是 AI 协作的必修课,不是对 AI 的不信任,而是对这种协作方式的正确理解,在可预见的未来,“验证> 信任” 永远适用。

结论

  1. 核心认知统一:AI 无真正的理解、推理、创造、共情能力,所有表现都是统计模式匹配的结果;AI 不是魔法,只是统计学和工程学的胜利,其能力边界由训练数据和任务结构决定。
  2. 人机协作的核心原则:AI 是人类的超强助手,而非替代者,用好 AI 的关键是理解其本质,明确人机分工,让 AI 做模式匹配的执行工作,人类掌握思考、判断、决策的主动权。





 

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐