Agent Telemetry

V100 推論叢集 · DGX 訓練研究
快照2026-08-04_0025UTC+8 · 每 3 小時更新

服務

fable-9b · V100:8600
健康 · HTTP 200
Qwopus-27B regen · V100:8900
健康 · HTTP 200
工具呼叫
已上線 · 8/8 + 7/7
Hermes gateway
待啟用

V100 機櫃

GPU 0
fable-9b 生產
32053 / 32510 MiB
util 0 %
GPU 1
regen server TP2
29695 / 32510 MiB
util 97 %
GPU 2
regen server TP2
29695 / 32510 MiB
util 96 %
GPU 3
測試 / 優化台
10 / 32510 MiB
util 0 %

背景產線

DSpark target cache 建置 · DGX1000 / 5093 · 19.6%
完成後自動點火 10-epoch 訓練
Qwopus-27B regen 資料生成 · V100 TP21109 / 8931 · 12.4%
可斷點續傳,供訓練資料擴量

吞吐量實測

9B-Q4_K_M · 短提示 · 單卡×1 · TQ-2bit
現行生產
65.8 tok/s
9B-Q4_K_M · 短提示 · TP4×1 · TQ-2bit
可切換
107.0 tok/s
9B-Q4_K_M · 64K · TP4×1 · TQ-2bit s160
92.0 tok/s
27B-Q4_K_M · 64K · TP4×1 · TQ-2bit s160
翻案
38.4 tok/s
9B-Q4_K_M · 64K · TP4×8人 · TQ-2bit s160
每人
28.7 tok/s
0每使用者 tok/s107
已撤回的數字

52.5 tok/s / 每人 — 當時以隨機 token 當提示,掩蓋了輸出退化,而退化的輸出解碼更快,反而灌高數字。基準測試現已內建真實文本的詞彙重複度斷言。

本期紀事

修復
TPFIX2 — 多卡輸出從此正確
此 vLLM fork 的張量並行輸出從來沒對過(9B / 27B 都是亂碼)。逐層 dump 定位到 out_proj 的 rank 切片與各卡持有的 head 集合對不上,修好後 TP2 / TP4 首次產出正確文字。
修復
SPECFIX — CUDA graph capture 缺陷根治
capture 時把 CPU 純量烘進圖裡,導致「快但輸出壞」與「正確但很慢」二選一。改成 verify-as-decode 後兩難消失。
翻案
27B 從判死到可用
單卡 14.5 tok/s(判定不可用)→ TP4 單人 38.4,首次越過 30 的互動門檻。
交付
fable-9b 工具呼叫上線
hermes parser + qwen3 reasoning + 支援 tools 的對話模板。非串流 8/8、串流 7/7 通過;含 tool_calls JSON、結果回灌、think 不外洩。
研究
DSpark 訓練方向修正
比對論文後找出三個方向性錯誤:drafter 容量過大、資料規模不足、confidence 排程未部署。已用輕量 drafter 重啟訓練。
事故
PSU 陣亡並更換
多模型同時載入的主板軌尖峰疑似壓垮電供,停機 15 小時。已改為序列載入紀律;四卡與載板無損。

下一步

自動產生 · 自有硬體推論與訓練研究狀態2026-08-04_0025