Agent 工作週報
快照時間 2026-08-03_2354 (UTC+8) · 每 3 小時更新
服務狀態
fable-9b 生產端點 (V100:8600)健康 (HTTP 200)
Qwopus-27B regen server (V100:8900)健康 (HTTP 200)
工具呼叫 (tool calling)已上線 · 非串流 8/8 · 串流 7/7
Hermes gateway尚未啟用 (待 Wayne E2E)
背景產線
DSpark target cache 建置 (DGX)900 / 5093
完成後自動點火 10-epoch 訓練
Qwopus-27B regen 資料生成 (V100 TP2)915 / 8931
可斷點續傳,供 DSpark 資料擴量
V100 GPU 配置
| GPU | 用途 | 記憶體 | 使用率 |
| 0 | fable-9b 生產 | 32053 MiB | 0 % |
| 1 | regen server (TP2) | 29695 MiB | 100 % |
| 2 | regen server (TP2) | 29695 MiB | 100 % |
| 3 | 測試 / 優化台 | 10 MiB | 0 % |
效能實測 (誠實數字)
| 配置 | per-user |
| 9B-Q4_K_M @短文 | TQ-2bit | 單卡×1 (現行生產) | 65.8 tok/s |
| 9B-Q4_K_M @短文 | TQ-2bit | TP4×1 | 107 tok/s |
| 9B-Q4_K_M @64K | TQ-2bit s160 | TP4×1 | 92 tok/s |
| 9B-Q4_K_M @64K | TQ-2bit s160 | TP4×8 | 28.7 tok/s |
| 27B-Q4_K_M @64K | TQ-2bit s160 | TP4×1 | 38.4 tok/s |
舊的「52.5 tok/s/user」已撤回 —— 當時用隨機 token 提示,掩蓋了輸出退化,
而退化流解碼更快會灌水。benchmark 現已內建真實文本 uniq-word 斷言。
本期完成
- TPFIX2 — 修好 vLLM fork 的多卡 out_proj 切片,此 fork 的多卡輸出從來沒正確過(9B/27B 皆亂碼),現已正確
- SPECFIX — 修好 CUDA graph capture 把 CPU 純量烘進圖的缺陷,消除「快但輸出壞 / 正確但很慢」二選一
- 27B 判決翻案 — 單卡 14.5 → TP4 單人 38.4,首次跨過 30 tok/s 的可用門檻
- 工具呼叫上線 — hermes parser + qwen3 reasoning + 支援 tools 的模板,串流與非串流全數驗收通過
- DSpark 訓練方向修正 — 審計出 drafter 容量、資料規模、confidence 排程三個方向性錯誤,已用小 drafter 重啟訓練
下一步
- Wayne 做 Hermes gateway E2E 並啟用工具呼叫
- DSpark 小 drafter 訓練完成 → τ (accepted length) 對比舊 checkpoint,裁決容量修正是否正確
- regen 資料收齊 → 資料擴量重訓
- 單卡短文 TPS 旋鈕掃描(greedy fastpath / batched-tokens / capture 集合)