想尝试一下用 llama.cpp 在本地 Windows 电脑上运行一个翻译模型,把一部分中文内容翻译成英文。折腾了一上午,终于安装好了。之前在 Windows 上使用过 Ollama, 参照前文,Ollama 安装 Google Gemma 3n 模型,整体上 llama.cpp 比 ollama 稍微麻烦一点点,但是差别不大。
llama 就是羊驼的意思🦙。。。
下载 llama.cpp
因为我想指定安装目录,毕竟这台老电脑 C 盘系统盘剩余空间不多了。于是没有使用 powershell 命令安装,而是采用直接下载 exe 可执行文件的方式。下载地址:
https://github.com/ggml-org/llama.cpp/releases
找到 Windows x64 (CPU) 版本,直接下载即可。最大的惊喜是,这个 zip 包只有 19M,比 ollama 的安装包可小太多了。印象中 ollama 有 700M 以上。解压之后,就能直接使用了。里面有一堆 exe 文件,稍后了解一下每个的作用。
然后把 llama.cpp 的解压目录设置到系统的环境变量 PATH 中,方便在命令行中调用。
下载模型
只是下载了 llama.cpp 还啥也干不了,还缺少模型。官方是推荐使用下面的命令安装模型:
# Download and run a model directly from Hugging Face
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
# Launch OpenAI-compatible API server
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
但是,大家都知道,在国内是无法直接访问 Hugging Face 的。所以,就需要找到一个镜像站。
https://modelscope.cn
打开之后,在里面搜索你想安装的模型即可。例如我想安装的是 Hy-MT2-1.8B,搜索到
https://modelscope.cn/models/Tencent-Hunyuan/Hy-MT2-1.8B-GGUF
点击下载模型,按照提示,先安装 python 依赖
pip install modelscope
然后使用安装好的 modelscope 进行下载
modelscope download --model Tencent-Hunyuan/Hy-MT2-1.8B-GGUF README.md --local_dir ./dir
把 README.md 替换为你想下载的 .gguf 文件名即可。这个模型 1G 左右。
跑起来
执行
llama-server -m Hy-MT2-1.8B-Q6_K.gguf --port 8080
会看到提示:
0.00.003.588 I srv llama_server: initializing ...
0.00.022.599 I cmn common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.023.015 W srv llama_server: security: no API key is set and CORS allows all origins (see https://github.com/ggml-org/llama.cpp/pull/25655)
0.00.029.825 I srv load_model: loading model 'Hy-MT2-1.8B-Q6_K.gguf'
0.00.851.910 W load: special_eos_id is not in special_eog_ids - the tokenizer config may be incorrect
0.04.102.178 I cmn init: llama threadpool init, n_threads = 6
0.38.440.620 I srv load_model: initializing, n_slots = 4, n_ctx_slot = 216064, kv_unified = 'true'
0.38.547.017 I srv llama_server: model loaded
0.38.547.623 I srv llama_server: listening on http://127.0.0.1:8080
当看到 listening on http://127.0.0.1:8080 说明跑起来了(需要耐心等几秒钟)。这时就可以在浏览器里使用了

界面跟 DeepSeek 网页版类似。后面测试一下如何用 Python 调用,这样就能本地自动跑一些翻译任务了。长文翻译效果,参考对本篇文章做的全文翻译 Install llama.cpp on Windows 11 and download to run the first local model