DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
DGX agentarXiv:2607.07946v1 Announce Type: cross Abstract: DeepSWE is a benchmark of 113 original, long-horizon software engineering tasks for evaluating coding agents. Most public agentic coding benchmarks fo