2月中旬阿里 Qwen 团队放了个大招——Qwen 3.5 系列一口气覆盖了从 0.8B 到 397B 的完整尺寸矩阵。作为一个坚持「本地优先」策略的人,我第一时间就盯上了那几个小模型。

这篇文章记录我用 Ollama 在笔记本上部署 Qwen 3.5 小模型的完整过程,包括踩过的坑、实际性能数据,以及不同硬件的选型建议。

先说结论:小模型不"小"了

Qwen 3.5 这代小模型最让人惊讶的是性能跃迁。9B 模型在 MMLU-Pro、GPQA Diamond 等基准测试中,直接超过了上一代 3 倍大的 Qwen3-30B,部分指标甚至接近 Qwen3-80B。

更具体地说:

  • 9B 模型在 10B 参数以下类别中,得分大约是第二名(Falcon-H1R-7B、NVIDIA Nemotron Nano 9B V2)的两倍
  • 4B 模型尽管参数减半,在多项测试中也超越了 7-9B 级别的竞品
  • 在 MMMU-Pro 视觉推理上,9B 拿到 70.1 分,超过 GPT-5-Nano(57.4)和 Gemini 2.5 Flash-Lite(59.7)

这意味着什么?18 个月前需要花几百美元 API 费用才能用上的"前沿"模型能力,现在一台笔记本就能免费跑。 这就是小模型进化的速度。

部署全流程:Ollama 三行命令搞定

第一步:安装 Ollama

去 ollama.com下载对应系统的安装包。Windows、macOS、Linux 都支持。安装过程一路下一步,没有任何需要手动配置的地方。

Linux 用户也可以一行命令:

curl -fsSL https://ollama.com/install.sh | sh

第二步:拉取模型

# 推荐起步:4B 版本(适合大多数笔记本)ollama pull qwen3.5:4b# 显存充裕的话,直接上 9Bollama pull qwen3.5:9b# 极简场景:0.8B(树莓派都能跑)ollama pull qwen3.5:0.8b

第三步:开聊

ollama run qwen3.5:9b

没有 Python 环境配置,没有 CUDA 驱动纠结,没有模型格式转换。Ollama 把所有脏活都干完了。

如果你需要 API 调用(比如接入自己的应用),Ollama 自带 OpenAI 兼容接口:

curl http://localhost:11434/api/chat \  -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"你好"}]}'

我的测试环境

为了给出一个「普通人」视角的参考,我没用服务器,用的是一台日常办公笔记本:

  • GPU: RTX 4060 Laptop(8GB 显存)
  • RAM: 32GB DDR5
  • 系统: Windows 11
  • Ollama 版本: v0.17.x(最新稳定版)

显存占用实测

这是大家最关心的部分。通过 nvidia-smi 实时监控,以下是各模型在 Q4 量化下的实际显存占用:

模型Q4 量化显存FP16 显存模型文件大小
0.8B~1.5 GB~3 GB0.9 GB
2B~2.3 GB~5.9 GB1.5 GB
4B~3.5 GB~10.6 GB2.5 GB
9B~6.5 GB~22.4 GB5.5 GB
27B~17.3 GB~64.9 GB16 GB

重要提醒: 上面是模型加载的基础占用。实际运行时还要加上 KV 缓存——上下文越长,额外占用越多。我实测 9B 模型在 4K 上下文长度下,总占用约 9.8 GB,超出了 8GB 显存,有约 2GB 溢出到系统内存。

8GB 显存的实际体验: 跑 4B 非常流畅,跑 9B 可以用但会有轻微卡顿(部分层回退到 CPU 推理)。如果你是 8GB 显存,建议直接选 4B,别纠结

推理速度实测

测试方法:中英文混合对话,输入约 500 tokens,生成约 200 tokens。

模型首 token 延迟生成速度体感
0.8B< 1s~80 t/s瞬间出结果
2B~1s~65 t/s非常快
4B~2s~52 t/s流畅自然
9B~3s~45 t/s比阅读速度快
9B (部分CPU)~5s~28 t/s可用但能感知延迟

45 tokens/s 是什么概念?正常人阅读速度约 300 字/分钟,而 45 t/s 意味着模型输出比你看得还快。日常对话完全够用。

一个重要的坑:多模态功能

Qwen 3.5 小模型是原生多模态的,支持图片理解。但这里有个坑——截至目前,Qwen 3.5 的 GGUF 格式在 Ollama 中无法使用多模态功能,因为视觉编码器(mmproj 文件)是独立的。

如果你需要图片理解能力,目前有两个方案:

  1. 用 llama.cpp 直接跑——支持加载独立的 mmproj 文件
  2. 等 Ollama 官方适配——预计很快会支持

纯文本对话不受影响,Ollama 运行完全正常。

实际应用场景

光跑分没意义,关键是日常好不好用。

代码助手(9B)

给了一段有 bug 的 Python 异步代码,模型准确定位了 await 缺失的问题,修复后的代码可以直接运行。还顺便指出了一个潜在的资源泄漏风险。水平大致相当于一个中级开发者。

有个有趣的数据:Qwen 3.5-9B 在 RTX 3060(12GB)上处理代理编码任务(agentic coding)时表现出色,说明即使是中端显卡也能胜任编程辅助。

文档摘要(4B)

20 页技术白皮书,要求生成 500 字结构化摘要。输出质量不错,关键数据点全部覆盖,没有明显的幻觉问题。4B 模型在这类任务上性价比极高。

数学推理(9B)

Qwen 3.5-9B 在 GSM8K 数学推理测试中比 Llama 3 8B 高出近 15 分。实际测试中,给它算一些业务指标(环比增长率、加权平均等),结果准确。

长文本处理

Qwen 3.5 支持最大 256K tokens 上下文窗口,而且对比 Llama 系列,"中间遗忘"问题更轻。实测喂了一篇 3 万字的文档做摘要,处理完整没有丢信息。

不过建议日常使用控制在 32K 以内——上下文越长,显存占用越大,速度也会下降。

和云端 API 怎么选?

坦白说,复杂推理(数学证明、多步代码重构、需要世界知识的问题)上,9B 跟 Claude Sonnet、GPT-4o 还有差距。但以下场景,本地部署优势明显

场景本地优势
处理敏感数据数据不出本机,零隐私风险
离线环境高铁、飞机上照样用
高频调用无 token 计费,成本为零
低延迟要求无网络传输,响应更快
嵌入应用本地 API 稳定可控

我个人的策略是混合使用:日常对话、文档整理、代码辅助用本地模型;需要深度推理、创意生成时再调云端 API。这样每月 API 开销能控制在 20 块以内。

硬件选型建议

你的设备推荐模型备注
8GB 显存笔记本Qwen 3.5-4B最佳平衡点
12GB 显存Qwen 3.5-9B性价比之王
16GB+ 显存Qwen 3.5-9B可以开更长上下文
Mac M系列 16GBQwen 3.5-9B统一内存优势明显
只有核显/CPUQwen 3.5-2BCPU 推理也够用
树莓派/边缘设备Qwen 3.5-0.8B能跑就行

进阶玩法

如果你想进一步压榨性能,可以试试:

  1. llama.cpp 直接部署——支持更精细的量化控制和多模态
  2. Unsloth Dynamic 2.0 量化——自动将关键层升级到 8/16-bit,精度更好
  3. vLLM 部署——适合做成 API 服务,多并发场景效率更高
  4. 开启 MTP(多 token 预测)——配合 vLLM 可以将推理速度再提升 30-50%

最后

Ollama + Qwen 3.5 的组合,真正做到了「开箱即用的本地大模型」。如果你还没试过本地部署,现在是最好的时机——不需要懂深度学习,不需要折腾环境,三条命令,十分钟搞定。

在 AI 能力快速普及的今天,本地部署不只是极客的玩具,它是每个知识工作者应该掌握的基础技能。自己的数据自己掌控,自己的算力自己说了算。

#AI本地部署 #Qwen3.5 #Ollama #大模型 #AI工具推荐

这里给大家精心整理了一份全面的AI大模型学习资源包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。
在这里插入图片描述

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

在这里插入图片描述

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

在这里插入图片描述

4. 2026行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战

学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

在这里插入图片描述

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

在这里插入图片描述

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇
在这里插入图片描述

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐