长页面
外观
下面显示从第1条到第50条的共50条结果。
- (历史) 模型:Gemini 3 Pro [4,885字节]
- (历史) 模型:Gemini 3.5 Pro [4,753字节]
- (历史) 模型:MiniMax M3 [4,682字节]
- (历史) 模型:DeepSeek V3.2 [4,557字节]
- (历史) 模型:Claude Fable 5 [4,533字节]
- (历史) 模型:Claude Sonnet 5 [4,508字节]
- (历史) 模型:Gemini 3.1 Pro [4,451字节]
- (历史) 模型:DeepSeek-R1 [4,402字节]
- (历史) 模型:GPT-5 mini/nano [4,349字节]
- (历史) 模型:Claude Mythos 5 [4,341字节]
- (历史) 模型:Grok 4.5 [4,248字节]
- (历史) 模型:GPT-5.2 [4,174字节]
- (历史) 模型:GLM-5.2 [4,130字节]
- (历史) 模型:Doubao Seed 2.0 [4,046字节]
- (历史) 模型:GLM-4.6 [4,045字节]
- (历史) 模型:GPT-5 [4,005字节]
- (历史) 测试集:GDPval [3,939字节]
- (历史) 模型:Qwen3 [3,920字节]
- (历史) 模型:Kimi K2 [3,864字节]
- (历史) 模型:Kimi K3 [3,857字节]
- (历史) 模型:Qwen3.7-Max [3,832字节]
- (历史) 模型:DeepSeek V4 Flash [3,808字节]
- (历史) 模型:Gemini 3.6 Flash [3,795字节]
- (历史) 模型:Kimi K2.6 [3,771字节]
- (历史) 测试集:EQ-Bench [3,700字节]
- (历史) 模型:Claude Sonnet 4.6 [3,680字节]
- (历史) 测试集:ARC-AGI [3,667字节]
- (历史) 模型:Mistral Large 3 [3,630字节]
- (历史) 测试集:Terminal-Bench [3,610字节]
- (历史) 模型:GPT-5.5 [3,599字节]
- (历史) 测试集:SWE-bench Pro [3,589字节]
- (历史) 测试集:FrontierSWE [3,582字节]
- (历史) 模型:豆包 2.0-lite [3,577字节]
- (历史) 模型:Qwen3-Coder [3,573字节]
- (历史) 测试集:NYT Connections(Extended) [3,566字节]
- (历史) 测试集:MCP Atlas [3,555字节]
- (历史) 测试集:AA-Omniscience [3,536字节]
- (历史) 模型:Gemini 3 Flash [3,529字节]
- (历史) 测试集:DeepSWE [3,515字节]
- (历史) 测试集:SVG-Bench [3,510字节]
- (历史) 测试集:BrowseComp [3,479字节]
- (历史) 测试集:SWE-Marathon [3,468字节]
- (历史) 测试集:Codeforces Rating [3,467字节]
- (历史) 测试集:MMLU [3,466字节]
- (历史) 模型:GPT-5.6 Sol [3,461字节]
- (历史) 测试集:HealthBench [3,442字节]
- (历史) 测试集:OpenHands Index [3,439字节]
- (历史) 测试集:LMArena(Arena) [3,437字节]
- (历史) 测试集:KernelBench [3,432字节]
- (历史) 模型:Llama 4 [3,432字节]