Model Releases
Agents-A1-4B (Qwen3.7-4B ???) : Scaling the Horizon, Not the Parameters
MODEL + GGUF : https://huggingface.co/InternScience/models?search=a1-4b Technical Report Benchmark Qwen3.5-4B Agents-A1-4B Qwen3.5 Qwen3.6 Nex-N2-mini Agents-A1 π§ Dense Models (~4B) π MoE Models (35B-
MODEL + GGUF : https://huggingface.co/InternScience/models?search=a1-4b Technical Report Benchmark Qwen3.5-4B Agents-A1-4B Qwen3.5 Qwen3.6 Nex-N2-mini Agents-A1 π§ Dense Models (~4B) π MoE Models (35B-A3B) π Long-horizon Search BrowseComp 47.2 66.8 61.0 67.9 74.1 π₯ 75.5 XBench-DS-2510 73.0 π₯ 90.0 77.0 71.0 82.0 86.0 Seal0 31.5 45.8 41.4 38.7 49.6 π₯ 56.4 GAIA 58.3 95.1 59.8 78.6 82.5 π₯ 96.0 βοΈ Engineering & Research Tasks SciCode 16.1 29.6 37.7 35.8 29.9 π₯ 44.3 MLE-Lite 7.6 22.7 24.2 34.9 34.9 π₯ 43.9 LiveCodeBench-V6 55.8 59.6 76.2 π₯ 78.1 59.1 76.2 FrontierScience-Research 1.7 33.3 2.5 2.9 5.0 π₯ 40.0 π Instruction Following IFBench 59.2 69.1 70.2 64.4 54.1 π₯ 80.6 LongBench-v2 50.0 52.1 59.0 57.7 59.6 π₯ 60.2 IFEval 89.8 π₯ 94.8 91.9 91.3 88.4 π₯ 94.8 π€ General & Scientific Agentic Tasks ΟΒ²-Bench 79.9 78.2 π₯ 81.2 79.0 74.5 79.8 VitaBench 22.0 π₯ 40.3 31.9 35.6 23.0 38.8 MatTools 10.9 π₯ 49.3 21.0 15.9 34.1 47.1 submitted by /u/KokaOP [link] [comments]
Related
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- APEX-Agents now has a @huggingface leaderboard for open-source models. APEX-Agents is our frontier benchmark for whether models can do the rβ¦
Source: r/LocalLLaMA | 2026-07-15