这一集讲的是怎么在云端租 GPU 来部署开源大语言模型。家里没有好显卡的话,这条路线很值得考虑——这次用的是 AutoDL 算力云(视频里就不直接点名供应商了,免得被误判成广告)。

进入算力市场之后,可以看到很多可以租用的 GPU,比如 RTX 4090、3080 之类的。演示里挑了一张 3080,准备部署一个 Qwen-2.5-0.5B 的小模型。

点击创建主机之后,页面会给出 SSH 登录指令和密码。我们打开本地终端,用 SSH 命令和密码登录到远程服务器,接着执行命令拉取镜像、把 HuggingFace 上对应的千问模型下载到本地目录;下载完成后,用 vLLM 命令指定这个目录,把模型跑起来。

模型跑起来之后,再打开一个新的终端,通过命令建立一个隧道,把远端端口映射到本地。这样一来,本地就可以直接访问本地端口,来调用远端跑起来的大模型了。发一个本地 curl 命令测试一下,可以看到已经跑通了。剩下的就是把它接入你的 Claude Code、Codex 这类 AI 工具,大家慢慢玩。

下面是这一整套流程的完整命令,可以直接照着复制。

前置条件

AutoDL 实例已开机,选用 CUDA 镜像,并且已经成功 SSH 连上容器。

完整部署流程(AutoDL + vLLM + Pi)

前置:仅首次部署执行一次(在 AutoDL 容器内)

1
2
3
pip install -U huggingface_hub
# 镜像自带 vllm 则注释掉下面一行
pip install vllm

步骤 1:一次性下载模型(重启实例不用重下)

1
2
3
4
export HF_ENDPOINT=https://hf-mirror.com
python -c "from huggingface_hub import snapshot_download;snapshot_download('Qwen/Qwen2.5-0.5B-Instruct',local_dir='/root/autodl-tmp/qwen05b',ignore_patterns=['*.xet'])"
# 校验模型文件
ls /root/autodl-tmp/qwen05b

步骤 2:启动 vLLM 服务(窗口必须保持常开)

1
vllm serve /root/autodl-tmp/qwen05b --host 0.0.0.0 --port 6006 --api-key sk-test123 --served-model-name qwen05b

等待日志里出现 Uvicorn running on http://0.0.0.0:6006,就代表服务已经就绪。

步骤 3:Mac 本机建立 SSH 隧道(新开终端,保持常开)

1
ssh -CNg -L 6006:127.0.0.1:6006 -p 22745 root@connect.westb.seetacloud.com

其中 22745 替换成你自己的 SSH 端口。

步骤 4:Mac 本机 curl 测试接口

1
curl http://127.0.0.1:6006/v1/chat/completions -H "Authorization: Bearer sk-test123" -H "Content-Type: application/json" -d '{"model":"qwen05b","messages":[{"role":"user","content":"你好"}]}'

步骤 5:接入 Pi(测试通过后执行)

1
2
3
4
export OPENAI_BASE_URL=http://127.0.0.1:6006/v1
export OPENAI_API_KEY=sk-test123
export OPENAI_MODEL=qwen05b
pi

三个终端的分工

  • 终端 A:SSH 连到 AutoDL 容器,跑 vLLM(保持常开)

  • 终端 B:Mac 本地,建立 SSH 隧道(保持常开)

  • 终端 C:Mac 本地,执行 curl 测试 / 启动 pi

  • 实例重启后:跳过模型下载,直接执行步骤 2 启动 vLLM 即可

  • 访问入口