指南 02 / 集群部署
在整个集群中部署
从试点批次到数千台矿机:先建立基线,再分批可观测地推进,批次之间设停止关卡,并指定一名回退负责人。
让矿场活下来的那条规则切勿一次性刷写整个矿场。每一批都必须可回退,并且在下一批开始之前得到观察。
阶段 01 · 基线
- 记录现状导出当前算力、功耗、温度区间以及每个 worker 的错误率。这正是日后比对的依据:没有它,之后的任何数字都只是一种意见
- 确定矿场的限制环境温度、断路器余量、发电机上限(如果有)。正是它们决定了您可以使用哪一种调优档位
- 指定回退负责人一个人,指名到人,可以不开会就决定停止并回退
阶段 02 · 试点批次
- 选取 1-5 台矿机与集群主体同型号、同控制板、同类机位
- 通过 Toolkit 安装分组扫描、选中该批次、安装固件、确认
- 不加干预地运行 24-48 小时若昼夜环境温差较大,则再延长
- 与基线比对接受算力、J/TH、芯片温度离散度、拒绝份额、风扇占空比。其中任何一项走向不利,就是停止信号
阶段 03 · 可观测的分批推进
- 第一批:集群的 10-20%只用通过了试点的那一套,相同设置、相同文件
- 守住关卡观察整整一天。集群总量与最差的那台 worker 都必须留在您接受的区间之内
- 扩大批次数字站得住就翻倍。一旦站不住,立即停止并回退
- 只保留一层控制集中监控、每批一个决策关卡、一名负责人。而不是每班一张表格
停止条件:在第一批之前就写下来
- 芯片温度超出您为矿场设定的区间
- 拒绝份额升到基线之上
- 任何需要人工干预才能恢复的矿机
- 任何无法在一个班次之内回退的批次
VNISH GLOBAL 是 VNISH 固件的全球分发、文档与支持生态。经校验的固件目录、控制板对应关系与版本发布历史均在此维护
固件数据集 · 控制板 · 验证固件 · 网络构成