环境搭建 & Transformers 入门

Transformer文档手册

https://hugging-face.cn/docs/transformers/index

HF注册 获取token

信息填写时国家写美国,尽量填写全

模型下载

下载hf

curl -LsSf https://hf.co/cli/install.sh | bash

登录

hf auth login

下载模型

hf download meta-llama/Meta-Llama-3-8B-Instruct --local-dir ./Meta-Llama-3-8B-Instruct
hf download meta-llama/Llama-3.1-8B-Instruct --local-dir ./Llama-3.1-8B-Instruct

调参

max_new_tokens

中文大约 1 token ≈ 0.7–1 个汉字(跟分词器有关,只做粗略估算)。
比如想要 800–1000 字的回答,可以设置 max_new_tokens ≈ 800 ~ 1200,再视显存和速度调整。

top_p

把所有 token 按概率从大到小排序;
从上往下累加概率,直到和 ≥ top_p;
只在这个“核”里面采样,其余低概率词直接丢弃。

和 top_k 的区别:
top_k:保留前 k 个最高概率词。
top_p:保留概率累积到 p 的那批词,数量是动态的。

temperature

把模型算出的 logits 除以一个系数 T,再做 softmax:
T = temperature
T < 1:把分布压得更“尖”
T > 1:把分布拉得更“平”
temperature 小(接近 0)
把“原本就高概率”的词拉得更高
把“原本就低概率”的词压得更低
输出更稳定、重复性强、很少“冒险”
temperature 大(>1)
高概率词和中等概率词差距被缩小
模型更愿意尝试非主流词
输出更多样,有创意,但也更容易胡言乱语

任务类型 temperature top_p 说明
事实问答 / 检索问答 0.0 – 0.3 0.8 – 1.0 降低胡编乱造概率
文本翻译 0.0 – 0.3 0.9 – 1.0 尽量确定性输出
摘要 / 关键信息抽取 0.1 – 0.4 0.9 稍微留一点多样性
代码补全 / 单元测试生成 0.0 – 0.3 0.8 – 0.95 不要太随机
教学/解释型回答 0.4 – 0.7 0.9 回答自然一些
正常聊天 0.6 – 0.8 0.9 更像人聊天
文案/故事/脑暴 0.8 – 1.0 (最多 1.2) 0.9 – 0.95 高多样性,高创意

GitHub 仓库:From0to1-MLLM-StudyLog
👉 仓库地址:
https://github.com/wz940216/From0to1-MLLM-StudyLog.git
这个仓库主要是我的「多模态大模型学习日志」,特点有几点:

  • 从机械专业转过来的视角: 不会扯太虚的理论,更偏工程、偏“怎么跑起来、怎么部署”。
  • 按周记录: 仓库按 Week1–Week24 组织,每周会尽量放上:
    • 这一周我大概在学什么(LLM、多模态、部署相关);
    • 看过的论文/文档/视频链接;
    • 跑通的代码、小 demo 或踩过的坑。
  • 覆盖方向大致包括:
    • LLM 基础(Qwen/LLaMA 等开源模型的使用与微调)
    • 多模态基础(CLIP、BLIP、LLaVA 这些经典框架)
    • 简单多模态小项目(比如图像-文本检索、图像问答等)
    • 推理与部署(vLLM、TensorRT、OpenVINO 等)

目前仓库还在持续更新,很多东西也在边学边补充,不是教程,更像给自己和同样想转型的人留一份可以复盘的轨迹。

想说给同样在纠结「要不要转大模型」的你
我不是科班 AI 出身,中间也走了机械 → 工业视觉 → 互联网 CV 这一大圈;
现在开始正式补多模态和大模型,说早不早,说晚不晚。
如果你也:

  • 本科专业不对口;
  • 在传统 CV / 工业视觉 / 算法岗位;
  • 对大模型很感兴趣,又有点不知道从哪下手;

可以先不用给自己「转行成功」的压力,我们可以先做两件小事:

  1. 承认这是趋势,允许自己慢慢靠过去;
  2. 让学习过程有迹可循——不管是记在本子上,还是像我一样丢在 GitHub 上。

如果你对多模态大模型感兴趣,或者也在准备往大模型方向转,可以:

  • 先收藏 / Fork 我的仓库: https://github.com/wz940216/From0to1-MLLM-StudyLog.git
  • 在评论区留个「一起学」, 后面我会继续把每周的学习记录、踩坑经验(包括机械狗视角下的弯路)陆续更新到仓库和这里。
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐