AutoDL!云端GPU部署开源大语言模型怎么玩?几乎零成本!
这一集讲的是怎么在云端租 GPU 来部署开源大语言模型。家里没有好显卡的话,这条路线很值得考虑——这次用的是 AutoDL 算力云(视频里就不直接点名供应商了,免得被误判成广告)。
进入算力市场之后,可以看到很多可以租用的 GPU,比如 RTX 4090、3080 之类的。演示里挑了一张 3080,准备部署一个 Qwen-2.5-0.5B 的小模型。
点击创建主机之后,页面会给出 SSH 登录指令和密码。我们打开本地终端,用 SSH 命令和密码登录到远程服务器,接着执行命令拉取镜像、把 HuggingFace 上对应的千问模型下载到本地目录;下载完成后,用 vLLM 命令指定这个目录,把模型跑起来。
模型跑起来之后,再打开一个新的终端,通过命令建立一个隧道,把远端端口映射到本地。这样一来,本地就可以直接访问本地端口,来调用远端跑起来的大模型了。发一个本地 curl 命令测试一下,可以看到已经跑通了。剩下的就是把它接入你的 Claude Code、Codex 这类 AI 工具,大家慢慢玩。
下面是这一整套流程的完整命令,可以直接照着复制。
前置条件
AutoDL 实例已开机,选用 CUDA 镜像,并且已经成功 SSH 连上容器。
完整部署流程(AutoDL + vLLM + Pi)
前置:仅首次部署执行一次(在 AutoDL 容器内)
1 | pip install -U huggingface_hub |
步骤 1:一次性下载模型(重启实例不用重下)
1 | export HF_ENDPOINT=https://hf-mirror.com |
步骤 2:启动 vLLM 服务(窗口必须保持常开)
1 | vllm serve /root/autodl-tmp/qwen05b --host 0.0.0.0 --port 6006 --api-key sk-test123 --served-model-name qwen05b |
等待日志里出现 Uvicorn running on http://0.0.0.0:6006,就代表服务已经就绪。
步骤 3:Mac 本机建立 SSH 隧道(新开终端,保持常开)
1 | ssh -CNg -L 6006:127.0.0.1:6006 -p 22745 root@connect.westb.seetacloud.com |
其中 22745 替换成你自己的 SSH 端口。
步骤 4:Mac 本机 curl 测试接口
1 | curl http://127.0.0.1:6006/v1/chat/completions -H "Authorization: Bearer sk-test123" -H "Content-Type: application/json" -d '{"model":"qwen05b","messages":[{"role":"user","content":"你好"}]}' |
步骤 5:接入 Pi(测试通过后执行)
1 | export OPENAI_BASE_URL=http://127.0.0.1:6006/v1 |
三个终端的分工
终端 A:SSH 连到 AutoDL 容器,跑 vLLM(保持常开)
终端 B:Mac 本地,建立 SSH 隧道(保持常开)
终端 C:Mac 本地,执行 curl 测试 / 启动 pi
实例重启后:跳过模型下载,直接执行步骤 2 启动 vLLM 即可
相关工具已收录于 AI工具严选

AutoDL
国内主流的云端 GPU 算力租用平台,按小时计费




