你会做什么
我们正在构建下一代 Agent 评测与运行时基础设施,你将深度参与其中:
- 独立负责 Agent Harness 的核心模块开发,覆盖任务定义、运行调度、结果采集与评分链路的端到端交付
- 参与 Harness Runtime 的设计与优化,包括沙箱隔离、工具调用注入、上下文回放与异常恢复等关键机制
- 围绕 Agent 行为做深度分析,识别评测盲区,设计能真实反映 agent 能力边界的 benchmark 场景
- 持续集成并深度定制开源 harness 框架,重点围绕 deepseek harness、codex 等框架,读透源码、结合内部产品场景进行二次扩展
- 与 Agent 产品团队协作,将评测结论转化为可落地的优化方向,形成「评测 → 定位 → 改进 → 回归」的完整飞轮,并探索以 RSI(Recursive Self-Improvement) 为目标的持续自我迭代机制
技术背景
基础要求
- 计算机 / 软件 / 人工智能等相关专业在读,能独立 debug 和解决工程问题
- 对 Agent 优化有 sense:理解 prompt、tool call、memory、planning 等环节对 agent 表现的影响,不只是跑通 pipeline,而是知道哪里会出问题、为什么
- 熟悉 Harness Runtime 的核心概念:任务生命周期管理、环境初始化与重置、执行隔离、结果校验逻辑
- 熟悉至少一个开源 Harness 框架,读过源码,能二次开发,重点包括:
- deepseek harness 及其评测体系
- codex 相关评测框架
- 有 Python 工程实践能力,能写出可维护、可扩展的评测脚手架代码
- 实际用过 AI 编程工具(Cursor、Claude Code、Copilot 等)并融入日常开发流程
技术栈参考(有相关经验优先,不限于此)
- 语言:Python 为主,Golang / TypeScript 加分
- Agent 框架:LangChain / LangGraph / AutoGen / CrewAI 或自研链路
- 运行时 & 沙箱:Docker、subprocess 隔离、虚拟文件系统、工具 mock
- 评测工程:任务序列化、并发调度、指标聚合、结果可视化
- 工程基础:Git、CI/CD、能读懂并写清楚技术文档
加分项(Nice to have)
完全符合上面的特质,以下只是额外亮点,不是门槛。
- 自己设计过 agent 评测场景或写过评测脚本,有可访问的代码或报告
- 参与过开源 harness / benchmark 项目的贡献(PR、issue 分析均可)
- 对某个具体 agent 失败模式有深入研究,能讲清楚根因和改进思路
- 参加过 Hackathon,享受在限定时间内把想法变成真实可跑的系统
- 在 AI / NLP / 系统方向有论文或研究经历