数据方法
这一页写清楚 VRAMGlass 上每个数字是怎么来的:价格从哪里抓、怎么清洗、能跑与速度用什么公式、汇率来自哪里,以及发现错了怎么告诉我们。
价格口径
二手价是在售挂牌价的中位数,不是成交价。中国大陆取闲鱼,美国取 eBay Browse API,两边走同一套流程:按关键词搜索 → 正则清洗标题 → 取中位数,同时记下四分位与样本数。
清洗规则每台设备一份:必须命中的词、必须排除的词(矿卡、配件、代购、仅镜头之类),以及一个参考价。清洗完用 MAD(中位数绝对偏差)剔掉离群点,MAD 为 0 时退回 1.5 倍 IQR。剩下的样本少于 3 条就不发布这一轮,宁可留空也不给一个假中位数。
还有一道发布守卫:新一轮的中位数比上一条已发布的偏离超过 35%、且样本不足 8 条时,这一轮只留快照、不进历史;整轮有效设备少于 5 台就整轮作废,保留上一份快照。抓取每 6 小时一轮,历史按 6 小时槽位保留 30 天。
能跑与速度
weights_gb = params_b × bytes_per_param × 1.05
权重显存 = 参数量 × 每参数字节 × 1.05。每参数字节按量化档位取:Q4_K_M 0.57、Q5_K_M 0.69、Q8_0 1.06、FP16 2;那个 1.05 覆盖 GGUF 元数据与不量化的嵌入层这类固定开销。
kv_gb = 2 × layers × kv_heads × head_dim × context × 2
KV cache = 2 × 层数 × KV 头数 × 头维度 × 上下文 × 2 字节(K 与 V 两份,FP16)。MLA 与线性注意力混合结构上这个通用公式会严重高估,模型库里给了实测的每 token 字节数时优先用实测值;滑动窗口注意力没有单独建模,长上下文下给出的是上界。
fits = weights_gb + kv_gb + 1 ≤ vram_gb
ms_per_token = (active_params_b × bytes_per_param + kv_cache_gb ÷ 2) ÷ (bandwidth_gbs × eff) × 1000 + overhead_mstokens_per_sec = 1000 ÷ ms_per_token
装得下 = 权重 + KV cache + 1GB 运行开销 ≤ 可用显存,单卡、不做 CPU offload;统一内存机器按内存总量算,不扣 macOS 的 GPU 占用上限。预估速度按 llama.cpp 单流口径:每 token 耗时 = 读取字节 ÷(带宽 × 生态效率)+ 固定开销,读取字节 = 激活参数 × 量化字节 + 上下文一半的 KV cache。生态效率 CUDA 0.7、ROCm 0.5、Metal 0.55、oneAPI 0.45;固定开销稠密模型 0.8 ms、MoE 4 ms。按公开的 llama.cpp 实测校准,误差通常在 ±20% 内,上下文越长实际越慢。
三个单价
price_per_gb = used_price ÷ vram_gb
显存单价 = 二手中位价 ÷ 显存容量,单位是「币种 / GB」,是全站主表的默认排序列。
price_per_bandwidth = used_price ÷ (bandwidth_gbs ÷ 100)
带宽单价 = 二手中位价 ÷(带宽 ÷ 100),单位是「币种 / 100GB/s」。除以 100 只是为了让数字和显存单价落在同一量级,方便横着比。
price_per_tops = used_price ÷ int8_tops_dense
算力单价 = 二手中位价 ÷ INT8 稠密算力,单位是「币种 / TOPS」;没有公开 INT8 标称值的设备这一列留空。三个单价都按当前价格基准算,先折美元再除,与先除再折算等价。
汇率
价格一律按原币存储,显示时按当日汇率换算,基准币种是美元。汇率每日拉一次,失败就沿用上一日并在页脚标注。当前页面用的汇率日期是 2026年9月5日,来源 open.er-api.com。
数据来源
显卡规格来自厂商官方规格页、TechPowerUp GPU Database 与 Wikipedia 的显卡列表交叉核对,每台设备的数据文件里都带来源链接,收录 39 台设备。
模型参数来自 Hugging Face 的模型 API 与仓库里的 config.json,各量化的权重体积取 GGUF 仓库的实际文件大小,Ollama 标签取自 Ollama 官方库,一共 8 个家族 37 个版本,每周同步一次。
更新频率与变更
价格每 6 小时一轮,模型库每周一轮,汇率每日一轮;页面上标的「数据更新于」是最近一轮真实成功的时间,不做假更新。规格与公式的改动都走 Git 提交,改了系数会在这里写明。
当前系数:每参数字节 Q4_K_M 0.57 / Q5_K_M 0.69 / Q8_0 1.06 / FP16 2,权重开销 1.05,KV 每元素 2 字节,运行开销 1GB,速度效率 {eff}。