← 返回项目
在线作品 · 公开仓库 · Mock 评测原型迭代中

Agent · 产品评测

Mobile UIAgent Evaluation Lab

面向移动 UI Agent 的 Streamlit Mock 评测平台;它用于验证评测产品结构,不执行真实设备操作。

Mobile UIAgent Evaluation Lab 的产品主页,展示任务评测、Case 设计、竞品分析和产品指标体系
真实产品截图Mobile UIAgent Evaluation Lab 的产品主页,展示任务评测、Case 设计、竞品分析和产品指标体系
用户问题
UI Agent 任务跨应用、多步骤且错误类型复杂,若没有标准用例和统一标签,结果很难复盘。
产品方案
用标准 Case 库、确定性 Mock 运行器、过程记录、八项指标和八类错误标签先验证评测产品结构,同时明确模拟结果不代表真实 Agent 能力。
我的职责
评测产品设计 / 数据结构 / 原型开发
真实产出
在线作品与公开仓库已可访问;当前确定性 Mock 评测平台不执行真实设备操作。
背景与目标

先确定为谁解决什么问题

目标用户
希望在接入真实执行器前,先验证 UI Agent 评测流程与数据结构的产品和评测人员。
产品目标
让不同 Agent 配置能够在同一套任务、指标和错误口径下进行结构化观察。
当前状态
在线作品 · 公开仓库 · Mock 评测原型

我的工作

  • 整理移动 UI Agent 的任务分类与用例结构
  • 定义指标、错误标签和结果记录字段
  • 设计可复现的确定性 Mock 运行逻辑
  • 完成结果看板与报告导出入口
AI 必要性

模型进入哪一步,为什么

Agent 的规划、定位与执行会形成连续链路,需要把最终结果和中间错误都纳入评测设计。

  • 任务库覆盖七类移动端操作场景
  • Mock 运行由固定输入产生可复现结果,便于验证页面和统计逻辑
  • 指标与错误标签同时呈现,避免只看总成功率
  • 多套 Agent 配置用于验证比较界面,不代表真实模型基准
人工节点

哪些判断不能交给模型

必须由人确认

  • 审核任务定义
  • 复核错误标签
  • 判断 Mock 结构能否迁移到真实执行器

安全与使用边界

  • 不把 Mock 结果描述为真实设备实测
  • 不执行真实账户操作
  • 报告需注明模拟数据来源
产品流程

从输入到反馈的完整路径

  1. 01选择 Agent 配置
  2. 02选择标准任务
  3. 03运行确定性 Mock
  4. 04记录步骤与结果
  5. 05聚合指标
  6. 06查看错误分布
  7. 07导出报告
原型证据

现有材料与缺失状态

评测方法

用什么观察产品是否更可靠

  • 任务成功率
  • 平均步骤数
  • 平均耗时
  • 操作准确率
  • 元素定位准确率
  • 恢复率
  • 安全违规率
  • 稳定性

当前重点

在线作品与公开仓库已可访问;当前确定性 Mock 评测平台不执行真实设备操作。

失败边界

明确哪些情况不算成功

已识别失败

  • 只记录最终成败
  • 模拟结果被误解为真实模型能力
  • 任务前置条件没有被写入用例

异常场景

  • 页面状态变化
  • 目标元素不存在
  • 步骤超限
  • 权限或登录前置条件缺失
迭代记录

从问题回到下一轮行动

CURRENT_REPOSITORY

接入真实设备执行器之前,评测页面、用例和统计口径缺少可运行载体。

判断
先用确定性模拟可以低成本验证产品结构,但必须清晰标注数据性质。
调整
仓库提供标准 Case、模拟记录、Agent 配置、指标看板与报告导出。
结果
当前公开仓库已形成可运行的 Mock 评测平台,不包含真实设备控制。
下一步
未来接入真实执行日志时,保留相同字段并新增环境与版本信息。
反思与来源

我从这个项目留下什么判断

评测原型可以先验证方法,但模拟结果与真实 Agent 能力必须严格区分。

后续计划

  • 接入真实执行器日志
  • 补充环境与版本字段
  • 验证错误标签的一致性
来源说明

已依据公开 GitHub 仓库与在线作品校对;页面明确标注为 Mock 评测原型,模拟数据不代表真实设备或真实模型结论。

为什么先做 Mock

真实移动端执行涉及设备、应用版本、账号和权限。当前仓库先验证评测产品本身:任务如何定义、过程如何记录、错误如何归类、结果如何比较。

可核验内容

  • 七类任务、四十三个标准 Case
  • 八项评测指标和八类错误标签
  • 六套用于界面比较的 Agent 配置
  • 一百二十五条以上模拟记录,用于验证统计与筛选

以上数量来自仓库 README,记录均为模拟数据,不代表真实设备或真实模型的测试结论。

站内搜索

搜索这个个人空间

输入关键词搜索项目、研究、随笔及其他页面。