# 组装了一块 32GB 巨大显卡跑本地大模型


大家好，我是罗孚，一位 AI 爱好者。

今天给大家介绍一下我的 32GB 巨大显卡。

## 眼见为实的巨大显卡

显卡，32GB，还巨大。没错，真的巨大。不信？你看：

![](static/giant-gpu-local-llm-01.webp)

上面是显卡，下面是 HP Z4G4 工作站。它们之间通过 8654 交叉线连接：

![](static/giant-gpu-local-llm-02.webp)

不得不说，尺寸确实相当巨大。完整尺寸如下：

![](static/giant-gpu-local-llm-03.webp)

是的，这实际上是一块安装在机箱里的显卡，内部由两块 SXM2 V100 显卡组成。

## 巨大显卡详细介绍

好吧，下面详细介绍一下这块巨大显卡。

正如前面所说，它实际是由两块 SXM2 版 V100 显卡组成的。

![](static/giant-gpu-local-llm-04.webp)

然后再连接到转接底板上：

![](static/giant-gpu-local-llm-05.webp)

再加上两块 x16 转接卡，就可以组成这块“巨大显卡”了。

它的原理基本就是这样。不过，真正需要购买的东西还比较多：

> **显卡 2 块：NVIDIA Tesla SXM2 版 V100 16GB**
>
> **转接主板 1 张 + 转接卡 2 块：算是显卡主板**
>
> **8654 交叉线 4 根：用来连接显卡和主机 PCIe**
>
> **SXM2 原装散热器 2 个：主要散热设备**
>
> **显卡机箱 1 个：用来安装这块巨大显卡**
>
> **1850W 电源 1 个：提供充足供电**
>
> **12×12 小风扇 5 个：用于机箱和显卡周边散热**

基本就是这些，准备好之后就可以开始组装了。

散热器和小风扇：

![](static/giant-gpu-local-llm-06.webp)

显卡主角：

![](static/giant-gpu-local-llm-07.webp)

主板前面已经拍过，机箱、电源等部件在后面的组装过程中都会看到。

## 动手组装巨大显卡

讲完原理，下面就亲手组装一下这块巨大显卡。

没有专门拍全家福，但上面列出的东西一件都没有少。

### 第一步：将 SXM2 V100 显卡安装到显卡主板上

![](static/giant-gpu-local-llm-08.webp)

由于主板就是为 SXM2 显卡设计的，安装非常容易，拧上螺丝就行，基本属于无缝安装。

可以看到背面的螺丝情况：

![](static/giant-gpu-local-llm-09.webp)

### 第二步：贴上散热片

![](static/giant-gpu-local-llm-10.webp)

这一步是我额外加的。

主要原因是，我觉得散热器和显卡之间的间隙也应该增加一些散热措施，同时也算是给晶体管多一层保护。于是，我把硅胶片和散热片堆满显卡两边，高度与显卡基本持平。这样做之后，我心里会更踏实一些。

### 第三步：装上原装散热器和风扇

![](static/giant-gpu-local-llm-11.webp)

这款原装散热器确实大得吓人。我买的应该算是比较高的版本，没有选择矮款。

![](static/giant-gpu-local-llm-12.webp)

最终看起来效果还不错。主体部分基本完成，最重要的显卡也终于显露出了它巨大的一面。

不过，仅仅这样装完还不够。

如此巨大的散热器不能只依靠被动散热，还需要风扇从散热器的缝隙中送风，才能真正把热量带走。否则，热量会积在机箱内部，这显然不能接受。

所以，我在前后各安装了两个风扇，合计四个，整体散热风道也就基本清晰了。

![](static/giant-gpu-local-llm-13.webp)

务必注意风扇的出风方向。四个风扇需要朝向同一个方向吹，这样才能真正形成有效的散热风道。

### 第四步：给主板接上电源

![](static/giant-gpu-local-llm-14.webp)

这一步需要把电源上的大电源 PIN，以及显卡所需的电源 PIN 等，全部插到主板上。

到这里，电源部分基本就完成了。

### 第五步：在电脑上安装转接卡

接下来是在目标电脑上的安装，需要安装两块 PCIe 卡：

![](static/giant-gpu-local-llm-15.webp)

电脑主板至少需要带有两个 x16 PCIe 插槽。虽然 x8 也可以使用，但条件允许的话，尽量选择双 x16。

当然，如果 CPU 不带核显，还需要额外占用一个显卡插槽来连接显示器。

我的 Z4G4 就需要额外安装一块显卡。上图最下面那块 HD7750，就是用来连接显示器的显卡，只负责显示，不参与算力计算。我特意买了一块 AMD 显卡来承担这个任务。

### 第六步：接上 8654 转接线

![](static/giant-gpu-local-llm-16.webp)

就是这些长长的线，一共四根，接起来并不复杂，但需要注意它们是交叉连接的，具体如下图：

![](static/giant-gpu-local-llm-17.webp)

完成连接后，基本就可以上电检查了。

### 第七步：上电检查

正式装进机箱前，先进行一次上电检查。

注意：主板角落里有两个开关。一个用于 AT 和 MT 模式切换，另一个用于控制电源上电。

AT 模式会跟随电脑一起上电，MT 模式则是手动上电。一般建议使用 AT 模式即可。对于一台常年开机的设备来说，通常不需要频繁操作这两个开关。

先进入 Ubuntu 检查：

![](static/giant-gpu-local-llm-18.webp)

Ubuntu 24 下的驱动比较成熟，安装完成后基本就能识别。两块显卡合计 32GB 显存，已经正常显示出来了。

![](static/giant-gpu-local-llm-19.webp)

nvtop 的显示也比较正常。

接着进入 Windows 检查：

![](static/giant-gpu-local-llm-20.webp)

Windows 下同样能够识别两块显卡，但因为没有安装驱动，所以暂时无法直接使用。

我主要在 Ubuntu 下使用，因此没有继续处理 Windows 驱动。不过既然硬件已经能够识别，原则上应该可以安装对应驱动。

上电检查完成，32GB 显卡可以正常使用。接下来下电，准备装箱，把它真正做成一块“巨大显卡”。

### 第八步：将显卡装进机箱

![](static/giant-gpu-local-llm-21.webp)

下电之后，基本就可以把显卡装进机箱了。机箱尺寸是标准的，主板直接拧螺丝固定即可。

我买的 1850W 电源有点大，供电肯定没有问题，但安装时确实比较费劲。大家后续选择电源时，务必注意电源与机箱的匹配程度，电源不宜太长。

另外，由于显卡散热器尺寸较大，再加上 12×12 风扇后似乎无法完全放下，最终只能去掉靠近机箱后部的两个风扇。

不过，由于风是从内部向外吹，整体散热仍然可以接受。后续如果需要，还可以再买两个更薄的 12×12 风扇装进去。

既然两个散热器无法安装在机箱尾部，那我就把它们直接装到机箱前部，给整个机箱散热，这也是一个不错的方案：

![](static/giant-gpu-local-llm-22.webp)

盖上前面板之后，竟然一点也看不出来。

而且面板本身就是孔状结构，风可以直接穿透，完全没有问题。

后来我又发现机箱后面还可以再安装一个风扇，于是又在外面加装了一个。这样一来，整个风道就更加完整了：前面进风，后面排风，理论上已经足够散热。

![](static/giant-gpu-local-llm-23.webp)

好了，至此，32GB 巨大显卡正式安装完毕。

确实有点太大了，我就不继续给大家展示了。

## 大模型测试

费劲组装这块 32GB 巨大显卡，最终当然是为了在本地运行大模型。

下面简单测试一下：

![](static/giant-gpu-local-llm-24.webp)

35B 的千问，能够跑出 62 tokens/s 的速度，确实让人有些惊喜。

总体来说，还是相当令人满意的。

## 显卡之外的考虑

### 成本

这块巨大显卡的购买和组装，实际是在 2025 年 618 前后完成的。

现在已经过去一年多了，我才写下这篇文章，似乎有点过时。毕竟大模型更新得实在太快，而且现在似乎也不再像以前那样流行自建大模型。

除非确实存在本地部署的必要，否则很多人可能并没有特别强烈的意愿，包括我自己在内，实际使用场景也不算太多。

但是，不到 100 元/GB 的成本，大家是否愿意接受呢？

现在无论是购买一块 32GB 显存的显卡，还是租用一台拥有 32GB 显存的服务器，价格都不算便宜。如果自己拥有一块 32GB 显存的显卡，成本不到 100 元/GB，是否值得？

这个问题，可能每个人都会有不同答案。

我个人认为，如果确实有自建大模型的需求，这块显卡是值得的。

如果是为了进行大模型研究，需要反复折腾各种模型，那么用不高的价格获得 32GB 显存，自己动手玩一玩，同样是值得的。

不知道屏幕前的你怎么看？欢迎与我联系交流。

### 电费

上面说的是一次性的显性成本，隐性成本同样不小，这就是电费。

显卡的耗电量，大家应该都有所了解。这块巨大显卡在运行大模型时，大概会消耗多少电呢？

我抓拍了一次运行大模型时的较高功率值：

![](static/giant-gpu-local-llm-25.webp)

这意味着，如果一直运行大模型，大约两三个小时就要消耗一度电。一天下来，可能要消耗 10 度电左右。

按照电费计算，一天少则 5 元，多则 10 元。

这样的成本放在公司里可能问题不大，但对于个人长时间运行来说，确实需要认真考虑。

是否会被这样的电费吓退，也许同样取决于每个人的使用场景。

### 模型的选择

基于当前的模型发展情况，对于本地 32GB 显存的设备来说，什么样的模型比较合适？

一般来说，27B～36B 左右的模型比较合适，17B 左右的 Flash 模型也是不错的选择。

虽然模型进步得非常快，每一次更新都在不断超越上一代，但模型本身也在持续变大，小 B 模型越来越少，个人自行部署的可能性也越来越低。

不过，我还是很怀念过年前后的那段时间。

那时候我正在研究“龙虾”，也就是 openclaw。当时使用的是 glm-4.7-flash 模型，不仅速度快，智能化程度也完全够用。

所以，我个人比较感兴趣的模型可能是下面这些：

> glm-4.7-flash:q4_K_M
>
> qwen3.8:27b
>
> gemma4:31b

这些模型的显存占用都在 20GB 左右，剩余显存正好可以用于缓存，整体上会相对宽裕一些。

预计我会按照这个方向进行部署。

屏幕前的你，对于 32GB 显存的设备有什么模型推荐呢？欢迎留言交流。

好了，这块真正巨大的显卡就介绍到这里。

整个过程体现了罗孚超凡的组装能力。

当然，这是开玩笑的。

不过，罗孚确实认为，部署 20GB 左右显存占用的模型，自己 DIY 玩一玩，还是很有意思的。

你是否也对这种低成本、高显存的显卡感兴趣？

欢迎和我一起交流。



---

> 作者: [RoverTang](https://rovertang.com)  
> URL: https://rovertang.com/llm/dual-v100-local-llm/  

