Model Releases
To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software eng…
To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software engineers. That helped us examine tasks at scale while keeping
To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software engineers. That helped us examine tasks at scale while keeping expert judgment at the center.
Source: OpenAI (X) | 2026-07-08