什么是大模型

大模型(Large Model),通常也称为大语言模型(Large Language Model,LLM),是一种基于深度学习技术训练出来的人工智能系统,主要用于理解和生成人类语言。

AI大模型的特点

1. 模型规模大

大模型通常包含数十亿甚至数千亿个参数。这些参数可以理解为模型内部的“神经元连接”,决定了模型学习和处理信息的能力。

2. 训练数据庞大

模型会使用海量文本数据进行训练,包括书籍、论文、新闻、网页、代码等各种内容,从而学习语言规律和知识。

3. 泛化能力强

经过大规模训练后,模型能够完成问答、写作、翻译、编程、总结、推理等多种任务。


大模型的工作原理

简单来说:

通过学习大量文本,掌握语言规律和知识,然后根据用户输入的提示(Prompt)生成相应的输出。

其本质是根据已有内容预测下一个最可能出现的词语,从而形成连贯的回答。


深度学习与大模型

什么是深度学习

深度学习是一种利用多层(深层)人工神经网络,从大量数据中自动学习输入与输出映射关系的机器学习方法。

人工神经网络受到生物神经网络结构和工作方式的启发,是一种模拟人脑信息处理过程的计算模型。

通过深度学习训练得到的网络称为深度神经网络(Deep Neural Network),它可以看作一个复杂的函数,实现从输入到输出的各种转换。


大模型的分类

根据处理数据类型的不同,大模型主要分为:

1. 语言大模型

主要处理文本信息,例如 ChatGPT、通义千问、文心一言等。

2. 语音大模型

主要处理语音识别、语音合成等任务。

3. 图像大模型

主要用于图像识别、图像生成、目标检测等任务。

4. 多模态大模型

能够同时处理文本、图片、音频、视频等多种数据形式,实现跨模态理解与生成。


大模型是如何训练出来的

预训练大模型的底层原理较为复杂,但可以从以下三个阶段进行理解。

第一阶段:学会“说话”

首先收集海量文本数据,然后利用深度神经网络进行训练。

训练过程中,模型不断完成一个任务:

给定前面的内容,预测后面最可能出现的内容。

例如:

输入:

今天天气很好,我准备去

模型预测:

公园散步

经过海量文本的反复训练后,模型逐渐掌握语言规律,学会像人一样组织和生成语言。

由于训练数据极其庞大,几乎涵盖了互联网上能够获取的大量公开文本资源,因此模型能够生成流畅自然的回答。


第二阶段:理解用户意图

人类语言属于非结构化数据,同一种意思往往有多种表达方式。

例如:

  • 北京今天天气怎么样?

  • 北京天气如何?

  • 今天北京会下雨吗?

虽然表达不同,但用户的核心意图都是获取天气信息。

通过大量训练,模型逐渐学会理解用户意图,并根据上下文生成符合需求的回答。


第三阶段:反馈择优(对齐训练)

仅仅会说话和理解问题还不够,模型还需要学会提供更符合人类期望的回答。

对于同一个问题,模型可能生成多个不同答案,其中有些答案可能:

  • 不准确

  • 存在偏见

  • 不符合用户需求

  • 表达方式不够友好

因此,需要让人工对多个回答进行评价和排序:

  • 哪个回答更准确?

  • 哪个回答更有帮助?

  • 哪个回答更安全?

然后利用强化学习等技术继续训练模型,使其更倾向于生成高质量回答。

这一过程通常称为:

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)

通过这一阶段,大模型的回答会更加符合人类价值观和使用需求。


总结

大模型的训练过程可以概括为三个步骤:

① 学会说话 → ② 理解意图 → ③ 反馈择优

即:

利用海量数据进行预训练,掌握语言规律和知识;
通过理解用户输入识别真实需求;
再结合人工反馈和强化学习不断优化回答质量。

DeepSeek-R1

DeepSeek-R1的推理能力进入了第一梯队(媲美OpenAIo1)其训练和推理成本低(仅有OpenAI的十分之一)、速度快、技术全部开源;

大模型的运行需要极高的硬件资源,通常都是服务器集群并挂载数量众多的GPU(显卡)
为了满足低性能设备的运行,可以对大模型进行蒸馏。可以选用适合的模型

官网:GitHub - deepseek-ai/DeepSeek-R1 · GitHub

模型本身就是普通的文件,无法直接使用,需要特定的手段对模型进行部署,所以主要学习目标:私有化部署大模型构建聊天机器人

什么是聊天机器人?
聊天机器人是一种基于人工智能的目然语言处理技术开发的软件程序能够通过文本或语音与用户进行交互。它可以根据用户输入的问题或指
令,生成相应的回答或执行特定的操作。
我们要学什么?
在自己的电脑上,部署属于自己的聊天机器人(Windows、MacOS、Linux)
在云平台服务器上(Linux),部署属于自己的聊天机器人

不管是个人电脑还是云平台,搭建聊天机器人的步骤为:
1.后端和模型部署。
个人电脑,后端使用Ollama框架搭配deepseek-r1、qwen模型
云平台,后端使用LangChain框架搭配阿里云百炼平台、通义千问
2.前端部署,个人电脑或云平台均可使用Streamlit

ollama介绍

ollama:是一款旨在简化大型语言模型本地部署和运行过程的开源软件。
ollama提供了一个轻量级、易于扩展的框架,让开发者能够在本地机器上轻松构建和管理LLMs(大型语言模型)
通过ollama,开发者可以导入和定制自己的模型,无需关注复杂的底层实现细节。
是一款旨在简化大型语言模型本地部署和运行过程的开源软件。

利用windows配置wsl环境

我采用的是wsl来进行的,直接开启wsl

下一步去Microsoft Store安装ubuntu

安装 Ubuntu 后,发现启动界面与网上教程不一致。

我的情况却直接进入了:

root@DESKTOP-21JUC0T:~#

说明 Ubuntu 实例并没有正常完成初始化,而是直接以 root 用户身份启动,因此界面与教程中的显示不同。创建自己的用户,然后再配置默认登录用户,而不要长期使用 root 用户进行开发。

使用su - meimei切换用户

WSL在安装好Ubuntu后,自动安装了显卡驱动以及CUDA,可以通过命令:nvidia-smi验证

为了获得更好的命令行体验,安装了 Windows Terminal。并将ubuntu设置成为了默认命令框

ollama安装

下载不下来linux专用的ollama,但是黑马提供了安装包,利用百度网盘下载

usr/bin/ollama是系统搜索路径,不需要配置环境变量,可以直接执行

官网有可以直接执行的命令Linux - Ollama

Create a user and group for Ollama:

sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama
sudo usermod -a -G ollama $(whoami)

Create a service file in /etc/systemd/system/ollama.service:

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="PATH=$PATH"

[Install]
WantedBy=multi-user.target

Then start the service:

sudo systemctl daemon-reload
sudo systemctl enable ollama

因为主播显卡一般,所以,只能用来下载一个GPU运行较小的蒸馏模型。

因为重装过系统,所以接下来就是安装python和pycharm,参考

Pycharm安装教程(最新)_加配置python解释器教程+适配Win11+汉化教程 | 添柴不加火 - 添柴不加火 - 博客园

2026年python3.10保姆级安装教程(适配Win11)+避坑环境变量失效 | 添柴不加火 - 添柴不加火 - 博客园

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐