从零到一 | CV转多模态大模型 | week01 |环境搭建 & Transformers 入门
环境搭建 & Transformers 入门
Transformer文档手册
https://hugging-face.cn/docs/transformers/index
HF注册 获取token
信息填写时国家写美国,尽量填写全
模型下载
下载hf
curl -LsSf https://hf.co/cli/install.sh | bash
登录
hf auth login
下载模型
hf download meta-llama/Meta-Llama-3-8B-Instruct --local-dir ./Meta-Llama-3-8B-Instruct
hf download meta-llama/Llama-3.1-8B-Instruct --local-dir ./Llama-3.1-8B-Instruct
调参
max_new_tokens
中文大约 1 token ≈ 0.7–1 个汉字(跟分词器有关,只做粗略估算)。
比如想要 800–1000 字的回答,可以设置 max_new_tokens ≈ 800 ~ 1200,再视显存和速度调整。
top_p
把所有 token 按概率从大到小排序;
从上往下累加概率,直到和 ≥ top_p;
只在这个“核”里面采样,其余低概率词直接丢弃。
和 top_k 的区别:
top_k:保留前 k 个最高概率词。
top_p:保留概率累积到 p 的那批词,数量是动态的。
temperature
把模型算出的 logits 除以一个系数 T,再做 softmax:
T = temperature
T < 1:把分布压得更“尖”
T > 1:把分布拉得更“平”
temperature 小(接近 0)
把“原本就高概率”的词拉得更高
把“原本就低概率”的词压得更低
输出更稳定、重复性强、很少“冒险”
temperature 大(>1)
高概率词和中等概率词差距被缩小
模型更愿意尝试非主流词
输出更多样,有创意,但也更容易胡言乱语
| 任务类型 | temperature | top_p | 说明 |
|---|---|---|---|
| 事实问答 / 检索问答 | 0.0 – 0.3 | 0.8 – 1.0 | 降低胡编乱造概率 |
| 文本翻译 | 0.0 – 0.3 | 0.9 – 1.0 | 尽量确定性输出 |
| 摘要 / 关键信息抽取 | 0.1 – 0.4 | 0.9 | 稍微留一点多样性 |
| 代码补全 / 单元测试生成 | 0.0 – 0.3 | 0.8 – 0.95 | 不要太随机 |
| 教学/解释型回答 | 0.4 – 0.7 | 0.9 | 回答自然一些 |
| 正常聊天 | 0.6 – 0.8 | 0.9 | 更像人聊天 |
| 文案/故事/脑暴 | 0.8 – 1.0 (最多 1.2) | 0.9 – 0.95 | 高多样性,高创意 |
GitHub 仓库:From0to1-MLLM-StudyLog
👉 仓库地址:
https://github.com/wz940216/From0to1-MLLM-StudyLog.git
这个仓库主要是我的「多模态大模型学习日志」,特点有几点:
- 从机械专业转过来的视角: 不会扯太虚的理论,更偏工程、偏“怎么跑起来、怎么部署”。
- 按周记录: 仓库按 Week1–Week24 组织,每周会尽量放上:
- 这一周我大概在学什么(LLM、多模态、部署相关);
- 看过的论文/文档/视频链接;
- 跑通的代码、小 demo 或踩过的坑。
- 覆盖方向大致包括:
- LLM 基础(Qwen/LLaMA 等开源模型的使用与微调)
- 多模态基础(CLIP、BLIP、LLaVA 这些经典框架)
- 简单多模态小项目(比如图像-文本检索、图像问答等)
- 推理与部署(vLLM、TensorRT、OpenVINO 等)
目前仓库还在持续更新,很多东西也在边学边补充,不是教程,更像给自己和同样想转型的人留一份可以复盘的轨迹。
想说给同样在纠结「要不要转大模型」的你
我不是科班 AI 出身,中间也走了机械 → 工业视觉 → 互联网 CV 这一大圈;
现在开始正式补多模态和大模型,说早不早,说晚不晚。
如果你也:
- 本科专业不对口;
- 在传统 CV / 工业视觉 / 算法岗位;
- 对大模型很感兴趣,又有点不知道从哪下手;
可以先不用给自己「转行成功」的压力,我们可以先做两件小事:
- 承认这是趋势,允许自己慢慢靠过去;
- 让学习过程有迹可循——不管是记在本子上,还是像我一样丢在 GitHub 上。
如果你对多模态大模型感兴趣,或者也在准备往大模型方向转,可以:
- 先收藏 / Fork 我的仓库: https://github.com/wz940216/From0to1-MLLM-StudyLog.git
- 在评论区留个「一起学」, 后面我会继续把每周的学习记录、踩坑经验(包括机械狗视角下的弯路)陆续更新到仓库和这里。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)