AB

Agent Benchmark Lab

4A Agent × Model Quality Evaluation · isolated local MVP

隔離測試原則:實驗快照固定 agent contract、skills、fixture、工具與參數;Model 測試時只變更模型。所有 provider credentials 僅允許後端環境變數。
Search and select

Agent catalog

1. Test mode

只測一個變因

2. Run parameters

重跑與限制

Temperature 0.2 · max tokens 1,800 · Phase 1 無工具。

3. Optional fixture

選擇是否附固定資料

預設不帶任何客戶資料;只有選取 fixture 時才會隨所有模型送入同一份資料。

4. Your task

輸入這次要比較的任務

必填。這段任務會被固定、hash 並送給每一個比較模型。

5. Model pool

選擇候選模型

Codex OAuth 與 local key 都不會出現在瀏覽器、實驗快照或 logs。

Ready to run

建立 immutable experiment,再執行。

沒有 server-side credential 時,系統只產生明示的 simulation output,不會偽裝成模型品質結果。

Immutable benchmark record

實驗快照

hash 可區分 prompt、skills、fixture、工具 schema 變更,避免把漂移誤判成模型差異。

實驗只保存去識別化 fixture、agent metadata 與評測輸出;不保存 provider secret。
先選 Agent,建立第一個 benchmark。
Blind review

尚無測試結果

先以 Response A/B/C/D 評分。通過數據硬檢後,才可揭露模型與成本。

Simulation output 不能作品質決策;請設定 server-side provider credential 後再跑實際模型。
建立實驗後,匿名輸出會顯示在這裡。

Run history
尚無實驗紀錄。