发布时间:2016 年 GTC;架构:Pascal(GP100,16nm FinFET)
定位:数据中心计算加速卡,同时面向 HPC 高性能计算 + 早期深度学习训练 / 推理;无视频输出接口,不能直接当游戏显卡。

一、核心硬件规格(区分两大形态)
1)SXM2 模组版(服务器刀卡,DGX-1 标配,支持 NVLink)
- CUDA 核心:3584
- 显存:16GB HBM2(4096bit),带宽 732 GB/s
- 算力:
FP16:21.2 TFLOPS|FP32:10.6 TFLOPS|FP64:5.3 TFLOPS - TDP:300W;被动散热
- ✅ 支持 NVLink 高速互联(多卡通信远强于 PCIe)
普通 DIY 主机无法直接使用 SXM2 版本,仅限专用服务器主板
2)PCIe 3.0 x16 标准板(DIY 最常见,无 NVLink)
两个显存版本:
| 参数 | P100 PCIe 16GB | P100 PCIe 12GB |
|---|---|---|
| HBM2 带宽 | 720 GB/s | 540 GB/s |
| FP16 | 18.7 TFLOPS | 18.7 TFLOPS |
| FP32 | 9.3 TFLOPS | 9.3 TFLOPS |
| FP64 | 4.7 TFLOPS | 4.7 TFLOPS |
| TDP | 250W | 250W |
通用关键特性
- HBM2 堆叠显存 + CoWoS 封装:当年革命性技术,远高于同期 GDDR5 带宽;原生支持ECC 内存纠错(科研 / 仿真稳定性刚需)
- FP64 算力很强(游戏卡同年代几乎砍半双精度),适合有限元、分子模拟、CFD 流体计算
- 统一内存(Unified Memory)、页迁移引擎,简化 CUDA 开发
- 无 Tensor Core!(Tensor Core 从 V100 Volta 架构才出现)
👉 重要短板:不支持原生 FP16 混合精度加速内核,现代大模型训练效率远低于 V100/A100
二、优缺点总结
✅ 优势
- 大显存:16GB HBM2,二手低价,适合预算有限学习者
- 优秀双精度 FP64:同价位二手卡极少对手,小规模科学计算性价比高
- HBM2 高带宽,跑 SD 绘图、向量数据库、特征提取带宽敏感任务表现尚可
- Pascal 架构最高支持 CUDA 11.x,主流开源项目(llama.cpp、Ollama、SD)仍兼容
❌ 硬缺陷(选购重点避坑)
- 被动散热!原厂无风扇,机箱必须强风道,密闭小机箱极易过热降频;很多人额外加装风扇
- 无显示输出!主机必须搭配一张亮机卡(核显 / 低端独显)才能输出画面
- 功耗高 250W/300W,电源压力大
- 缺少 Tensor Core:现代 LLM、深度学习训练速度显著弱于 V100;不适合生产环境训练
- 架构老旧,NVIDIA 新特性逐步不再优化;不支持 FP8
三、当前适用场景(2026 年)
适合
- 学生 / 个人自学:本地跑 7B~13B 量化大模型推理(Ollama /llama.cpp)
- Stable Diffusion 画图,高分辨率出图依赖 16GB 显存
- CUDA 学习、小规模科学仿真、有限元、流体、生物分子计算
- 离线小规模数据处理、特征工程、视频编解码加速
不适合
- 大模型持续训练(速度慢,能耗性价比低)
- 线上生产推理集群
- 游戏(没有图形优化,性能极差)
- 需要 FP8、新一代 AI 框架深度优化场景
四、横向简单对比(热门二手计算卡)
- P100 16G:HBM2、强 FP64、无 TensorCore、250W,适合仿真 + 入门 AI 推理
- V100 16G:Volta、带 TensorCore,AI 速度明显更强,价格更高
- P40 24G:GDDR5,FP16 弱,适合纯推理,不适合仿真
- RTX 3090 24G:游戏卡,无 ECC,FP64 弱,但是自带视频输出、散热省心
五、选购建议
- 优先选 PCIe 16GB 版本,避开 12GB;SXM2 版本不要买,普通主板装不上
- 确认机箱风道,准备轴流风扇对着显卡吹;注意服务器机箱长度
- 系统建议 Linux(Ubuntu);Windows 驱动可用,但生态不如 Linux
- 定位:低成本学习实验卡,不要指望替代 V100 做正式训练
