SOTA Sync
全部文章
质量与安全2026-09-01

生成式 UI 也需要基准:A2UI-Bench 如何测协议、任务与体验

Macaron-A2UI 构建了 14,245 条训练样本与分层 A2UI-Bench,把生成式 UI 的能力拆成协议可执行性、任务构造和用户体验,并展示监督微调与强化学习带来的提升。

当模型开始输出按钮、表单、卡片和数据绑定,传统语言模型评测就不够用了。一段结果可能 JSON 完全合法,却没有完成任务;也可能字段齐全,却渲染成难以使用的界面。

Macaron-A2UI 试图同时解决训练数据和评测方法两个缺口。研究团队构建了一套 A2UI 语料,并提出 A2UI-Bench,把生成式 UI 能力拆成从“能不能执行”到“好不好使用”的三个层级。

同一对话使用纯文字和 A2UI 表单、动作卡片与结果卡片呈现时的差异同一对话使用纯文字和 A2UI 表单、动作卡片与结果卡片呈现时的差异

这项研究的核心判断是:生成式 UI 不是格式化文本任务,而是协议遵循、任务建模与视觉交互共同组成的系统能力。

#14,245 条样本如何构建出来

训练集包含 14,245 条样本,其中 10,210 条要求输出 UI,4,035 条保留为纯文字回答。保留文字样本很重要,因为模型首先要判断当前回复是否真的需要界面,而不是无论什么问题都机械地产生卡片。

数据来自四类现有对话语料:MultiWOZ 2.2、Schema-Guided Dialogue、ESConv 和 AnnoMI,覆盖任务型对话、情感支持与动机访谈。研究团队先统一对话格式,再生成 A2UI 中间表示,并通过确定性修复与验证删除或修正不合法结果。

Macaron-A2UI 从对话语料、统一表示、生成、确定性修复到验证的训练数据构建流程Macaron-A2UI 从对话语料、统一表示、生成、确定性修复到验证的训练数据构建流程

最终 UI 样本的可渲染率达到 99.2%。这说明数据管线对结构错误进行了强约束,但“可以渲染”仍不等于“任务正确”或“体验优秀”,因此论文又设计了分层基准。

#三层评测不能被一个 JSON 合法率替代

A2UI-Bench 把能力拆成 L1、L2 和 L3。

  • L1:协议与可执行性。 检查结构、引用、组件和数据绑定是否满足协议,结果能否真正进入渲染链路。
  • L2:任务构造。 判断模型有没有选对组件、字段、动作和信息关系,界面是否完成了用户提出的任务。
  • L3:用户侧效用。 关注信息是否清楚、交互是否合理、视觉呈现是否帮助用户理解与行动。

基准还区分原子任务、深度任务和宽度任务。原子任务测试单一组件或能力;深度任务增加嵌套和依赖;宽度任务要求模型同时组织更多并列内容。

这种拆法能够定位失败来源。如果 L1 很低,问题是协议遵循;L1 高而 L2 低,说明模型会写格式却不会建模任务;L1 和 L2 都高而 L3 低,才轮到视觉与交互设计问题。

#监督微调让模型学会格式,强化学习继续推高任务能力

研究使用 Qwen 系列模型进行 LoRA 监督微调,再以分层奖励进行 GRPO 强化学习。

30B 模型的总体分数从基础模型的 19.8 提升到监督微调后的 37.2,加入强化学习后达到 58.8。235B 模型则从 21.6 提升到 63.6,再达到 74.2。基于 GLM-5.1 的 Venti 得分为 75.6。

基础模型、监督微调、监督微调加强化学习,以及完整 Schema 前沿模型在 A2UI-Bench 各层的比较基础模型、监督微调、监督微调加强化学习,以及完整 Schema 前沿模型在 A2UI-Bench 各层的比较

作为完整 Schema 提示下的外部对照,论文报告 DeepSeek V3.1 为 63.8、Gemini 3.1 Pro 为 71.0、GPT-5.4 为 74.1。这些数字说明,专门训练的中等规模模型有机会逼近通用前沿模型,但不能据此推断它在其他 UI 协议或真实产品中同样领先。

#奖励必须对准不同失败层

强化学习阶段没有只优化最终总分,而是分别构造协议有效性、任务构造和用户体验奖励。训练曲线显示,30B 与 235B 模型的总奖励都在训练中上升,但不同层级的改善速度并不一致。

30B 与 235B Macaron-A2UI 模型在 GRPO 训练中的总奖励变化30B 与 235B Macaron-A2UI 模型在 GRPO 训练中的总奖励变化

这对实际系统有直接启发。若把渲染成功、任务正确和视觉质量压成一个奖励,模型很可能学会最容易优化的捷径:生成少量保守组件来避免协议错误,或者堆叠更多组件来提高覆盖率,却牺牲可用性。

更稳妥的训练与回归测试,应当保留分层指标,并为失败样本标记究竟在哪一层断裂。

#基准仍然存在自评风险

A2UI-Bench、训练数据和模型来自同一研究项目,评测规则与数据分布天然更贴近其方法。L2 与 L3 中还需要语言模型和视觉语言模型担任评审,评分会受到提示、裁判模型和渲染实现影响。

这篇论文目前是预印本,结果尚未经过独立复现。99.2% 可渲染率和模型排名都应理解为这套管线与基准下的结果,而不是生成式 UI 的通用行业结论。

尤其是“用户体验”不能长期只由另一个模型代替真实用户。VLM 适合大规模筛错,真实任务完成率、操作时间、误触、可访问性和用户信任仍需要产品侧实验。

#真正可复用的是分层质量模型

这项工作的长远价值未必是某个模型排名,而是把生成式 UI 的质量拆成了可执行、任务正确与用户有效三个层面。

生产系统可以据此建立一条更清楚的闸门:先做确定性 Schema 与引用验证,再用任务断言检查字段和动作,最后才评估视觉层级与交互体验。任何一层失败,都不应该被一张看起来不错的截图掩盖。

生成式 UI 只有从“展示 demo”走向“持续评测”,才可能成为可靠的软件界面。