职位概述
MazeAI 正在构建下一代会进化的Harness 系统。
它定义了我们如何描述一个任务、如何在受控环境中驱动 Agent 执行、如何采集中间状态并最终形成可信的评分结论。一个设计良好的 Harness 不仅是测试工具,更是我们理解 Agent 能力边界的认知框架——每一次运行都是一次对「Agent 到底有多聪明」的精确追问。
如果你对这个问题有发自内心的好奇,并且想把这种好奇心转化为跑在线上的基础设施,这个岗位是为你准备的。
核心方向
自进化(RSI)框架的设计与开发
- 以 RSI(Recursive Self-Improvement) 为长期目标,设计让 Agent 能够基于评测反馈持续自我迭代的框架机制——从「被动评测」走向「主动自进化」
- 构建可量化的能力基线与回归告警机制,确保每一轮迭代的评测结论持续可信
- 将评测结论转化为可落地的优化方向,形成「评测 → 定位 → 改进 → 回归」的完整飞轮,并持续加速这一飞轮的转速
Harness Runtime 设计与优化
- 参与 Harness Runtime 核心机制的设计,包括沙箱隔离、工具调用注入、上下文回放与异常恢复
- Harness 的 Runtime 层需要在严格的隔离约束下,忠实还原 Agent 的真实运行环境;你将负责设计这套环境的边界与行为契约
- 研究并解决多步长链路任务中的执行漂移、状态污染与中间结果丢失等工程难题
- 优化调度吞吐与资源利用率,让大规模并发评测在合理成本内稳定运行
Benchmark 场景设计
- 围绕 Agent 行为做深度分析,识别现有 Harness 评测体系的盲区与指标失真点
- 设计能真实反映 Agent 能力边界的 benchmark 场景,覆盖鲁棒性、工具依赖、上下文长度等多维度
- 一个好的 benchmark 场景本质上是一段精心设计的 Harness 配置:任务描述、执行约束、评分函数缺一不可;你需要同时具备对 Agent 行为的直觉和对 Harness 机制的深度理解
- 建立标注、清洗与持续更新的数据工作流,维护高质量评测语料库
持续学习与探索前沿AI 相关技术
- 持续追踪并深入研究前沿 Harness 框架与 Agent 优化技术,重点关注 lm-evaluation-harness、deepseek harness、codex 等方向的最新进展
- 读透关键项目的源码与设计理念,提炼可迁移的工程范式,而不是浅层了解
- 将外部前沿技术与内部评测场景结合,探索新的 Harness 设计模式和 Agent 能力提升路径
- 在团队内部形成技术洞察的传播与沉淀,推动整体技术视野持续更新
我们最看重的特质
- 思维方式:你的默认模式是质疑假设、重构问题,而不是沿用现成答案。
- 好奇心:你对 AI 和前沿技术保持强烈的探索欲——并且总想亲手试一试。
- 执行力:你会立刻把想法付诸行动;你用 Demo 和上线的产出说话,而不是 PPT。
- AI Native:AI 是你工作、学习和创造的默认方式,而不是偶尔拿起来用的工具。
- 长期主义:你相信技术可以改变世界,并愿意在真正重要的事情上投入时间。
背景要求
先说一句:如果你真正具备上述特质,以下内容都只是加分项。
加分项
- 有 Agent 评测框架、Harness 基础设施或 LLM benchmark 方向的研究或工程经验
- 深度使用或贡献过 lm-evaluation-harness、codex、BIG-Bench 等开源评测框架
- 有沙箱隔离、容器调度或分布式任务执行的工程经验
- 参加过 Hackathon、ACM/ICPC 或类似竞赛,并真正享受高强度的动手挑战
- 持续参与开源项目,或在真实项目中有长期负责、持续交付的记录
- 在 AI、系统或软件工程领域有论文发表或研究经历
基本背景
- 计算机科学、软件工程、通信、人工智能或相关专业背景
- 计算机基础扎实,能够独立解决工程与算法问题
我们团队的大多数成员来自国内一线科技公司,或经过严格技术训练的高校(985/211、QS 前列或同等水平)。但我们真正在意的,是真实能力和有据可查的产出,而不是标签。