构建真实任务
收集需要规划、工具调用、信息综合和产物交付的 Agent 任务,并保留真实环境中的约束。
Agent Evaluation Suite
AIPERT 正在构建面向 AI Agent 的评测任务、评分标准与轨迹检查工具,覆盖文件、浏览器、代码、文档、数据分析和长流程协作等真实工作场景。

Benchmark Design
收集需要规划、工具调用、信息综合和产物交付的 Agent 任务,并保留真实环境中的约束。
每个任务包含预期输出、约束条件、Rubrics说明,让模型表现可以被评测。
评估 Agent 的执行轨迹、中间产物和最终交付,并在自动评分不可靠的位置引入专家复核。
Evaluation Philosophy
关注 Agent 是否能在约束下完成工作:读取材料、操作工具、修改产物、从错误中恢复,并留下可评测的执行记录。
保留真实工作的复杂结构,同时明确评测边界。
区分必要、重要、附加和扣分项。
评测不仅看最终答案,也看 Agent 如何到达结果。
公开结论会绑定到版本化任务、记录材料和可复现实验。
Task Domains
仓库理解、问题修复、回归测试、文档更新和代码审查。
表格分析、网页研究、带来源综合和结构化抽取。
幻灯片、报告、PDF、电子表格、格式检查和修订任务。
多步浏览、表单交互、页面检查、比较判断和证据留存。
命令行、本地文件、服务检查、部署流程和错误恢复。
指令遵循、边界处理、风险意识和拒答质量。
Partners & Contributors
AIPERT 的合作网络会覆盖高校实验室、领域工作流专家、评测工程师和学生贡献者。以下展示位用于发布已确认的合作学校与合作人。
Agent 评测方法、任务构造与结果分析。
提供真实工作流、行业约束和专家复核标准。
负责环境封装、自动检查、轨迹采集和回归验证。
参与任务整理、标注复核、文档建设和案例维护。
Roadmap
评测集概览、评测原则和代表性任务类别。
版本化评测用例、评分标准、环境说明和验证材料。
模型与 Agent 的结果、轨迹分析、局限性和复核说明。
Agent 评测应该让进展变得可见:尝试了什么,完成了什么,失败在哪里,还有哪些需要人工复核。
Resources
Contact
AIPERT 欢迎围绕任务设计、评测方法、轨迹分析和领域评测集建设展开合作。
contact@aipert.top