跳转到内容

修订最少的页面

下面显示从第1条到第50条的共50条结果。

查看(上50条 | )(20 | 50 | 100 | 250 | 500

  1. 模型:DeepSeek V3.2​(1个版本
  2. 模型:GPT-5 mini/nano​(1个版本
  3. 测试集:AA Intelligence Index​(1个版本
  4. 测试集:CRUXEval​(1个版本
  5. 测试集:GraphWalks​(1个版本
  6. 测试集:MMMU​(1个版本
  7. 测试集:SWE-Marathon​(1个版本
  8. 模型:DeepSeek V4 Flash​(1个版本
  9. 模型:GPT-5​(1个版本
  10. 测试集:AA-Omniscience​(1个版本
  11. 测试集:CursorBench​(1个版本
  12. 测试集:HealthBench​(1个版本
  13. 测试集:MRCR​(1个版本
  14. 测试集:Τ²-Bench​(1个版本
  15. 模型:DeepSeek-V4​(1个版本
  16. 模型:Grok 4.5​(1个版本
  17. 测试集:ACEBench​(1个版本
  18. 测试集:DeepSWE​(1个版本
  19. 测试集:HLE(Humanity's Last Exam)​(1个版本
  20. 测试集:MultiPL-E​(1个版本
  21. 测试集:Terminal-Bench​(1个版本
  22. 模型:豆包 2.0-lite​(1个版本
  23. 模型:Grok 4​(1个版本
  24. 测试集:Agent Arena​(1个版本
  25. 测试集:Design Arena​(1个版本
  26. 测试集:HMMT​(1个版本
  27. 测试集:NYT Connections(Extended)​(1个版本
  28. 测试集:Toolathlon​(1个版本
  29. 测试集:USAMO​(1个版本
  30. 模型:Doubao Seed 2.0​(1个版本
  31. 模型:Grok 5​(1个版本
  32. 测试集:Aider Polyglot​(1个版本
  33. 测试集:DSBench​(1个版本
  34. 测试集:HumanEval​(1个版本
  35. 测试集:OpenHands Index​(1个版本
  36. 测试集:Vending-Bench​(1个版本
  37. 首页​(1个版本
  38. 模型:Gemini 3.1 Pro​(1个版本
  39. 模型:Kimi K2.6​(1个版本
  40. 测试集:AIME​(1个版本
  41. 测试集:EQ-Bench​(1个版本
  42. 测试集:IMO 2025​(1个版本
  43. 测试集:OPQA​(1个版本
  44. 测试集:Vibe Code Bench​(1个版本
  45. 模型:Claude Fable 5​(1个版本
  46. 模型:Gemini 3.5 Pro​(1个版本
  47. 模型:Kimi K2​(1个版本
  48. 测试集:AMC​(1个版本
  49. 测试集:EvalPlus​(1个版本
  50. 测试集:KernelBench​(1个版本

查看(上50条 | )(20 | 50 | 100 | 250 | 500