評估方法(Eval)
Labs 採「同一輸入、多後端並排」方式評估能力,結果發布在 Showcase 與各 lab 畫廊。 成片交付看編碼後檔案,不只看生成工具呼叫成功。
原則
- 可重現 — 固定 fixture、seed、manifest 記錄後端與參數
- 人工 QC — 自動 QA 輔助,關鍵資產(角色設定圖)以人工勾選為準
- 分 tier — featured / pipeline / legacy,避免混淆主鏈與實驗
- 公開試看 — 通過項目上線至 cs.3q.fi;失敗路線保留為反面教材
- 最終檔才算交付 — 工具路徑存在 ≠ 通過;對編碼後 MP4 / PNG 抽樣
三條驗證軌道
對齊 2026-08 X 研究;詳細決策見 測試驗證筆記 · 未關項見 未完成任務(CS-Q07–Q09)。
- 機械合約 —
proof-watch.py:解析度、fps、codec。CS-Q09 可選--mux-qa或PROOF_WATCH_MUX_QA=1。 - 抽幀聯繫表 —
proof-watch-frames.py:等間距 + CS-Q08--moments-tsv/--percent-moments。 - 視覺關係 — CS-Q07 人像局部 QC;字幕不交給生成模型;I2V 檢查主體數量與靜態錨點。
報告入口
Capabilities Eval 報告 →
研究筆記目錄 →
未完成任務 →
Image Edit Lab 對照表 →
Tech Eval Pilot →