把你微调好的模型用起来,现在主要有四种方法,你可以根据习惯和场景来选择。

我把它们的要点整理在了下面的表格里,方便你快速比较。

方法核心操作适用场景
方法一:直接推理通过 mlx_lm.generate 或 mlx_lm.chat 命令行,加载融合后的完整模型文件夹进行测试。最简单快速地验证模型效果,无需编写代码。
方法二:Python API在你的Python脚本中使用 mlx_lm.load 和 generate 函数加载模型,进行程序化集成。需要将模型嵌入到已有的Python项目中,进行代码集成。
方法三:部署API服务一行命令 mlx_lm.server 启动一个与OpenAI API兼容的本地服务器。为其他应用程序提供标准的API服务,或搭建Web应用。
方法四:用Ollama部署为融合后的模型编写 Modelfile,然后使用 ollama 命令创建和运行。偏好使用Ollama进行模型管理和交互。

四种使用方式

🚀 方法一:直接推理 (CLI)

这是最快、最简单的测试方法。打开终端,使用 mlx_lm.generate 命令,就能与你的融合模型对话。

mlx_lm.generate --model <你的融合模型保存路径> --prompt "你好,可以介绍一下你自己吗?"

如果想进行上下文对话,可以用 mlx_lm.chat 命令。

在终端里直接执行以下命令,就能开始和你的微调模型对话了:

mlx_lm.chat --model <你的模型路径>

或者

mlx_lm.chat --model <你的模型路径> --temp 0.7 --top-p 0.95
--temp / --temperature控制生成文本的随机性。值越低,输出越确定0.1 (保守), 0.8 (创造)可以组合使用,微调回答的多样性
--top-p核采样,控制词汇选择的多样性。0.9 (平衡), 0.95 (多样)

把 <你的模型路径> 替换成你之前 Fuse 合并后生成的完整模型文件夹 的路径就可以了。

命令执行后,终端会进入一个等待输入的 REPL(交互式解释器)模式,出现 > 提示符。你可以在 > 后面直接输入文字与模型对话。模型会结合之前的聊天历史进行回复,直接实现多轮上下文对话。

💻 方法二:Python API

你可以在 Python 代码中无缝集成模型,这是最灵活的方式。创建一个 .py 文件,复制下面的代码并修改模型路径即可运行。

from mlx_lm import load, generate

# 加载你的模型和分词器
model, tokenizer = load("<你的融合模型保存路径>")

# 准备对话
prompt = "你好,可以介绍一下你自己吗?"

# 应用Qwen3的聊天模板
messages = [{"role": "user", "content": prompt}]
prompt_with_template = tokenizer.apply_chat_template(messages, add_generation_prompt=True)

# 生成回答
response = generate(model, tokenizer, prompt=prompt_with_template, verbose=True, max_tokens=512)
print(response)
方法三:部署 API 服务

mlx-lm 可以非常方便地启动一个兼容 OpenAI API 的本地服务。这能让你用 curl 命令或任何支持 OpenAI SDK 的客户端来调用你的微调模型。

在终端执行以下命令,即可启动服务:

mlx_lm.server --model <你的融合模型保存路径>
方法四:用 Ollama 部署

如果你习惯于使用 Ollama 来管理和使用大模型,也可以将它作为一个"容器"来部署你的模型。

  1. 创建 Modelfile:在你的模型目录下创建一个名为 Modelfile 的文件(无后缀),文件内容如下

FROM <你的融合模型文件夹的绝对路径>
TEMPLATE """{{ if .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}{{ if .Prompt }}<|im_start|>user
{{ .Prompt }}<|im_end|>
{{ end }}<|im_start|>assistant
"""
PARAMETER temperature 0.7
PARAMETER top_p 0.8

    2. 创建并运行模型

ollama create my-qwen3-model -f ./Modelfile
ollama run my-qwen3-model

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐