llama.cpp 在 Windows 11 上安装,并下载运行第一个本地模型

文章目录

    想尝试一下用 llama.cpp 在本地 Windows 电脑上运行一个翻译模型,把一部分中文内容翻译成英文。折腾了一上午,终于安装好了。之前在 Windows 上使用过 Ollama, 参照前文,Ollama 安装 Google Gemma 3n 模型,整体上 llama.cpp 比 ollama 稍微麻烦一点点,但是差别不大。

    llama 就是羊驼的意思🦙。。。

    下载 llama.cpp

    因为我想指定安装目录,毕竟这台老电脑 C 盘系统盘剩余空间不多了。于是没有使用 powershell 命令安装,而是采用直接下载 exe 可执行文件的方式。下载地址:

    https://github.com/ggml-org/llama.cpp/releases

    找到 Windows x64 (CPU) 版本,直接下载即可。最大的惊喜是,这个 zip 包只有 19M,比 ollama 的安装包可小太多了。印象中 ollama 有 700M 以上。解压之后,就能直接使用了。里面有一堆 exe 文件,稍后了解一下每个的作用。

    然后把 llama.cpp 的解压目录设置到系统的环境变量 PATH 中,方便在命令行中调用。

    下载模型

    只是下载了 llama.cpp 还啥也干不了,还缺少模型。官方是推荐使用下面的命令安装模型:

    # Download and run a model directly from Hugging Face
    llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
    
    # Launch OpenAI-compatible API server
    llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
    

    但是,大家都知道,在国内是无法直接访问 Hugging Face 的。所以,就需要找到一个镜像站。

    https://modelscope.cn

    打开之后,在里面搜索你想安装的模型即可。例如我想安装的是 Hy-MT2-1.8B,搜索到

    https://modelscope.cn/models/Tencent-Hunyuan/Hy-MT2-1.8B-GGUF

    点击下载模型,按照提示,先安装 python 依赖

    pip install modelscope
    

    然后使用安装好的 modelscope 进行下载

    modelscope download --model Tencent-Hunyuan/Hy-MT2-1.8B-GGUF README.md --local_dir ./dir
    

    把 README.md 替换为你想下载的 .gguf 文件名即可。这个模型 1G 左右。

    跑起来

    执行

    llama-server -m Hy-MT2-1.8B-Q6_K.gguf --port 8080
    

    会看到提示:

    0.00.003.588 I srv  llama_server: initializing ...
    0.00.022.599 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
    0.00.023.015 W srv  llama_server: security: no API key is set and CORS allows all origins (see https://github.com/ggml-org/llama.cpp/pull/25655)
    0.00.029.825 I srv    load_model: loading model 'Hy-MT2-1.8B-Q6_K.gguf'
    0.00.851.910 W load: special_eos_id is not in special_eog_ids - the tokenizer config may be incorrect
    0.04.102.178 I cmn          init: llama threadpool init, n_threads = 6
    0.38.440.620 I srv    load_model: initializing, n_slots = 4, n_ctx_slot = 216064, kv_unified = 'true'
    0.38.547.017 I srv  llama_server: model loaded
    0.38.547.623 I srv  llama_server: listening on http://127.0.0.1:8080
    

    当看到 listening on http://127.0.0.1:8080 说明跑起来了(需要耐心等几秒钟)。这时就可以在浏览器里使用了

    llama.cpp WEB UI

    界面跟 DeepSeek 网页版类似。后面测试一下如何用 Python 调用,这样就能本地自动跑一些翻译任务了。长文翻译效果,参考对本篇文章做的全文翻译 Install llama.cpp on Windows 11 and download to run the first local model

    继续阅读

    Python 调用 llama.cpp 运行的模型