DeepSeek 开源了一个 Agent 评测工具:Harness 是什么?

DeepSeek 最近悄悄在 GitHub 上放出了一个叫 DeepSeek Harness 的开发者预览版。从命名也能猜到,它的核心定位就是给 Agent 做"测试场"——一个统一、可复现的评估框架。
先说它解决的问题。
做 Agent 研究的人都知道,最大的痛点不是写不出 Agent,而是怎么评估 Agent。同一个任务,换一个 prompt、换一种工具调用顺序、换一个大模型版本,结果可能天差地别。如果没有统一的跑分基准,每篇论文里的数字都像是在自说自话。
Harness 想做的就是这件事:把"任务定义、Agent 行为、环境交互、结果评分"这几件事标准化。具体来说,它有几个值得关注的设计点:
- 任务描述与执行分离:任务以结构化方式定义(输入、工具、评判标准),Agent 运行时只关心执行,方便横向对比不同 Agent 实现。
- 支持多模型后端:不绑定 DeepSeek 自家模型,理论上可以接入任何兼容 OpenAI API 协议的模型,这意味着你拿它来跑 Claude、GPT 或者本地开源模型都行。
- 可扩展的评分器:除了简单的字符串匹配,还内置了基于 LLM 的评判,方便处理开放式任务。
- 可复现性:环境、随机种子、依赖都做了固定,省去了"在我机器上能跑"的经典扯皮。
为什么值得点出来?因为目前 Agent 评测这块,业界还缺一个事实标准。SWE-bench、GAIA、AgentBench 各管一摊,DeepSeek Harness 这个方向如果走通,等于是给中文社区提供了一个从零搭建评测体系的脚手架——尤其对做工具调用、长链路推理这类研究的小团队来说,能省下不少工程时间。
当然,开发者预览版嘛,接口和功能肯定还会有变动,建议先 clone 下来跑跑 Quickstart,体感一下任务定义是否符合你那边的需求。等稳定版本出来,再考虑接入正式的工作流。
附原文出处与 Quickstart 链接已放在文末。
来源:Hacker News