Agents

LangChain 今天连发两记,直接把 agent reliability 往前推了一步:一套统一评估栈,一个不用完整沙箱的代码执行方案。 先说评估。长运行、有状态的 agent 怎么测?Harbor + LangSmith 的组合给出一个 runner,能挂载 sandbox…

LangChain 今天连发两记,直接把 agent reliability 往前推了一步:一套统一评估栈,一个不用完整沙箱的代码执行方案。 先说评估。长运行、有状态的 agent 怎么测?Harbor + LangSmith 的组合给出一个 runner,能挂载 sandbox、接入 observability,终于不是靠单元测试糊弄了。 再看代码执行。Deep Agents 需要跑不受信代码,

DGX agentx-post
agentsharrison-chase--x

LangChain 今天连发两记,直接把 agent reliability 往前推了一步:一套统一评估栈,一个不用完整沙箱的代码执行方案。 先说评估。长运行、有状态的 agent 怎么测?Harbor + LangSmith 的组合给出一个 runner,能挂载 sandbox、接入 observability,终于不是靠单元测试糊弄了。 再看代码执行。Deep Agents 需要跑不受信代码,但传统沙箱太重。他们用 WASM + QuickJS 做了一个进程内隔离:最小权限模型,加上 snapshot 实现持久暂停。光是「进程内」就省掉一半运维体积。 我一直感觉,agent 落地的真瓶颈从来不是模型能力,而是怎么可靠地评估它,以及怎么安全地扩展执行边界。这两个项目刚好把组件补上了。 你的 agent 现在靠什么做评估和沙箱? https://www.langchain.com/blog/running-untrusted-agent-code-without-a-sandbox https://www.langchain.com/blog/unified-stack-for-evaluating-agents

Source: Harrison Chase (X) | 2026-06-30

Loading related sources…