轻松上手微调模型的四大实用方法
·
把你微调好的模型用起来,现在主要有四种方法,你可以根据习惯和场景来选择。
我把它们的要点整理在了下面的表格里,方便你快速比较。
| 方法 | 核心操作 | 适用场景 |
|---|---|---|
| 方法一:直接推理 | 通过 mlx_lm.generate 或 mlx_lm.chat 命令行,加载融合后的完整模型文件夹进行测试。 | 最简单快速地验证模型效果,无需编写代码。 |
| 方法二:Python API | 在你的Python脚本中使用 mlx_lm.load 和 generate 函数加载模型,进行程序化集成。 | 需要将模型嵌入到已有的Python项目中,进行代码集成。 |
| 方法三:部署API服务 | 一行命令 mlx_lm.server 启动一个与OpenAI API兼容的本地服务器。 | 为其他应用程序提供标准的API服务,或搭建Web应用。 |
| 方法四:用Ollama部署 | 为融合后的模型编写 Modelfile,然后使用 ollama 命令创建和运行。 | 偏好使用Ollama进行模型管理和交互。 |
四种使用方式
🚀 方法一:直接推理 (CLI)
这是最快、最简单的测试方法。打开终端,使用 mlx_lm.generate 命令,就能与你的融合模型对话。
mlx_lm.generate --model <你的融合模型保存路径> --prompt "你好,可以介绍一下你自己吗?"
如果想进行上下文对话,可以用 mlx_lm.chat 命令。
在终端里直接执行以下命令,就能开始和你的微调模型对话了:
mlx_lm.chat --model <你的模型路径>
或者
mlx_lm.chat --model <你的模型路径> --temp 0.7 --top-p 0.95
--temp / --temperature | 控制生成文本的随机性。值越低,输出越确定 | 0.1 (保守), 0.8 (创造) | 可以组合使用,微调回答的多样性 |
--top-p | 核采样,控制词汇选择的多样性。 | 0.9 (平衡), 0.95 (多样) |
把 <你的模型路径> 替换成你之前 Fuse 合并后生成的完整模型文件夹 的路径就可以了。
命令执行后,终端会进入一个等待输入的 REPL(交互式解释器)模式,出现 > 提示符。你可以在 > 后面直接输入文字与模型对话。模型会结合之前的聊天历史进行回复,直接实现多轮上下文对话。
💻 方法二:Python API
你可以在 Python 代码中无缝集成模型,这是最灵活的方式。创建一个 .py 文件,复制下面的代码并修改模型路径即可运行。
from mlx_lm import load, generate
# 加载你的模型和分词器
model, tokenizer = load("<你的融合模型保存路径>")
# 准备对话
prompt = "你好,可以介绍一下你自己吗?"
# 应用Qwen3的聊天模板
messages = [{"role": "user", "content": prompt}]
prompt_with_template = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
# 生成回答
response = generate(model, tokenizer, prompt=prompt_with_template, verbose=True, max_tokens=512)
print(response)
方法三:部署 API 服务
mlx-lm 可以非常方便地启动一个兼容 OpenAI API 的本地服务。这能让你用 curl 命令或任何支持 OpenAI SDK 的客户端来调用你的微调模型。
在终端执行以下命令,即可启动服务:
mlx_lm.server --model <你的融合模型保存路径>
方法四:用 Ollama 部署
如果你习惯于使用 Ollama 来管理和使用大模型,也可以将它作为一个"容器"来部署你的模型。
-
创建 Modelfile:在你的模型目录下创建一个名为
Modelfile的文件(无后缀),文件内容如下
FROM <你的融合模型文件夹的绝对路径>
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.8
2. 创建并运行模型:
ollama create my-qwen3-model -f ./Modelfile
ollama run my-qwen3-model
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)