Agent · 产品评测
Mobile UIAgent Evaluation Lab
面向移动 UI Agent 的 Streamlit Mock 评测平台;它用于验证评测产品结构,不执行真实设备操作。

- 用户问题
- UI Agent 任务跨应用、多步骤且错误类型复杂,若没有标准用例和统一标签,结果很难复盘。
- 产品方案
- 用标准 Case 库、确定性 Mock 运行器、过程记录、八项指标和八类错误标签先验证评测产品结构,同时明确模拟结果不代表真实 Agent 能力。
- 我的职责
- 评测产品设计 / 数据结构 / 原型开发
- 真实产出
- 在线作品与公开仓库已可访问;当前确定性 Mock 评测平台不执行真实设备操作。
先确定为谁解决什么问题
- 目标用户
- 希望在接入真实执行器前,先验证 UI Agent 评测流程与数据结构的产品和评测人员。
- 产品目标
- 让不同 Agent 配置能够在同一套任务、指标和错误口径下进行结构化观察。
- 当前状态
- 在线作品 · 公开仓库 · Mock 评测原型
我的工作
- 整理移动 UI Agent 的任务分类与用例结构
- 定义指标、错误标签和结果记录字段
- 设计可复现的确定性 Mock 运行逻辑
- 完成结果看板与报告导出入口
模型进入哪一步,为什么
Agent 的规划、定位与执行会形成连续链路,需要把最终结果和中间错误都纳入评测设计。
- 任务库覆盖七类移动端操作场景
- Mock 运行由固定输入产生可复现结果,便于验证页面和统计逻辑
- 指标与错误标签同时呈现,避免只看总成功率
- 多套 Agent 配置用于验证比较界面,不代表真实模型基准
哪些判断不能交给模型
必须由人确认
- 审核任务定义
- 复核错误标签
- 判断 Mock 结构能否迁移到真实执行器
安全与使用边界
- 不把 Mock 结果描述为真实设备实测
- 不执行真实账户操作
- 报告需注明模拟数据来源
从输入到反馈的完整路径
- 01选择 Agent 配置
- 02选择标准任务
- 03运行确定性 Mock
- 04记录步骤与结果
- 05聚合指标
- 06查看错误分布
- 07导出报告
现有材料与缺失状态

用什么观察产品是否更可靠
- 任务成功率
- 平均步骤数
- 平均耗时
- 操作准确率
- 元素定位准确率
- 恢复率
- 安全违规率
- 稳定性
当前重点
在线作品与公开仓库已可访问;当前确定性 Mock 评测平台不执行真实设备操作。
明确哪些情况不算成功
已识别失败
- 只记录最终成败
- 模拟结果被误解为真实模型能力
- 任务前置条件没有被写入用例
异常场景
- 页面状态变化
- 目标元素不存在
- 步骤超限
- 权限或登录前置条件缺失
从问题回到下一轮行动
CURRENT_REPOSITORY
接入真实设备执行器之前,评测页面、用例和统计口径缺少可运行载体。
- 判断
- 先用确定性模拟可以低成本验证产品结构,但必须清晰标注数据性质。
- 调整
- 仓库提供标准 Case、模拟记录、Agent 配置、指标看板与报告导出。
- 结果
- 当前公开仓库已形成可运行的 Mock 评测平台,不包含真实设备控制。
- 下一步
- 未来接入真实执行日志时,保留相同字段并新增环境与版本信息。
我从这个项目留下什么判断
评测原型可以先验证方法,但模拟结果与真实 Agent 能力必须严格区分。
后续计划
- 接入真实执行器日志
- 补充环境与版本字段
- 验证错误标签的一致性
来源说明
已依据公开 GitHub 仓库与在线作品校对;页面明确标注为 Mock 评测原型,模拟数据不代表真实设备或真实模型结论。
为什么先做 Mock
真实移动端执行涉及设备、应用版本、账号和权限。当前仓库先验证评测产品本身:任务如何定义、过程如何记录、错误如何归类、结果如何比较。
可核验内容
- 七类任务、四十三个标准 Case
- 八项评测指标和八类错误标签
- 六套用于界面比较的 Agent 配置
- 一百二十五条以上模拟记录,用于验证统计与筛选
以上数量来自仓库 README,记录均为模拟数据,不代表真实设备或真实模型的测试结论。