Search and select
Agent catalog
1. Test mode
只測一個變因
2. Run parameters
重跑與限制
3. Optional fixture
選擇是否附固定資料
4. Your task
輸入這次要比較的任務
5. Model pool
選擇候選模型
Ready to run
建立 immutable experiment,再執行。
沒有 server-side credential 時,系統只產生明示的 simulation output,不會偽裝成模型品質結果。
Immutable benchmark record
實驗快照
實驗只保存去識別化 fixture、agent metadata 與評測輸出;不保存 provider secret。
先選 Agent,建立第一個 benchmark。
Blind review
尚無測試結果
Simulation output 不能作品質決策;請設定 server-side provider credential 後再跑實際模型。
建立實驗後,匿名輸出會顯示在這裡。
Run history
尚無實驗紀錄。