跳到主要内容

研发工程师

Agent harness 研发实习生

  • senior
  • onsite · 深圳

我们正在构建下一代 Agent 评测与运行时基础设施,你将深度参与其中:

你会做什么

我们正在构建下一代 Agent 评测与运行时基础设施,你将深度参与其中:

  • 独立负责 Agent Harness 的核心模块开发,覆盖任务定义、运行调度、结果采集与评分链路的端到端交付
  • 参与 Harness Runtime 的设计与优化,包括沙箱隔离、工具调用注入、上下文回放与异常恢复等关键机制
  • 围绕 Agent 行为做深度分析,识别评测盲区,设计能真实反映 agent 能力边界的 benchmark 场景
  • 持续集成并深度定制开源 harness 框架,重点围绕 deepseek harness、codex 等框架,读透源码、结合内部产品场景进行二次扩展
  • 与 Agent 产品团队协作,将评测结论转化为可落地的优化方向,形成「评测 → 定位 → 改进 → 回归」的完整飞轮,并探索以 RSI(Recursive Self-Improvement) 为目标的持续自我迭代机制

技术背景

基础要求

  • 计算机 / 软件 / 人工智能等相关专业在读,能独立 debug 和解决工程问题
  • 对 Agent 优化有 sense:理解 prompt、tool call、memory、planning 等环节对 agent 表现的影响,不只是跑通 pipeline,而是知道哪里会出问题、为什么
  • 熟悉 Harness Runtime 的核心概念:任务生命周期管理、环境初始化与重置、执行隔离、结果校验逻辑
  • 熟悉至少一个开源 Harness 框架,读过源码,能二次开发,重点包括:
  • 有 Python 工程实践能力,能写出可维护、可扩展的评测脚手架代码
  • 实际用过 AI 编程工具(Cursor、Claude Code、Copilot 等)并融入日常开发流程

技术栈参考(有相关经验优先,不限于此)

  • 语言:Python 为主,Golang / TypeScript 加分
  • Agent 框架:LangChain / LangGraph / AutoGen / CrewAI 或自研链路
  • 运行时 & 沙箱:Docker、subprocess 隔离、虚拟文件系统、工具 mock
  • 评测工程:任务序列化、并发调度、指标聚合、结果可视化
  • 工程基础:Git、CI/CD、能读懂并写清楚技术文档

加分项(Nice to have)

完全符合上面的特质,以下只是额外亮点,不是门槛。

  • 自己设计过 agent 评测场景或写过评测脚本,有可访问的代码或报告
  • 参与过开源 harness / benchmark 项目的贡献(PR、issue 分析均可)
  • 对某个具体 agent 失败模式有深入研究,能讲清楚根因和改进思路
  • 参加过 Hackathon,享受在限定时间内把想法变成真实可跑的系统
  • 在 AI / NLP / 系统方向有论文或研究经历

申请方式

安装 skill,让 AI 帮你完成投递全流程