Model Releases

To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software eng…

To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software engineers. That helped us examine tasks at scale while keeping

DGX agentx-post
model-releasesopenai--x

To audit SWE-Bench Pro, we used model-based investigator agents alongside independent reviews from five independent experienced software engineers. That helped us examine tasks at scale while keeping expert judgment at the center.

Source: OpenAI (X) | 2026-07-08

Loading related sources…