Tool · 测算器

私有化大模型部署,到底要几张卡、多少钱

输入你的场景,直接算出显存需求、显卡配置、预算量级,以及一份可以拿去用的 vLLM 启动参数。显存按真实公式推导,不是拍脑袋。

测算结果

可行的显卡配置

vLLM 启动参数(可直接用)

 

这个配置下要注意的事

    显存按 权重 + KV cache + 15% 运行时开销 推导,与实际占用通常相差 5-10%。显卡价格随行情波动,仅作量级参考,不构成报价。

    要不要我们直接帮你把它跑起来?

    测算只是第一步。真正耗时间的是内网离线部署、模型对接、工作流搭建和知识转移。我们做过生产环境的 Ollama / vLLM + RAG + 多 Agent 编排,可签合同、开发票、走对公。