文德数慧

从“能回答”到“能执行”:文德数慧构建真实 APP 场景下的Agent RL 环境

公司动态

Agent 正从问答、信息检索进入真实业务流程。当 Agent 开始操作 APP、调用工具、完成任务,评价标准也随之变化。一次任务是否完成,只是最基本的一层。它是否理解任务、路径是否合理、执行是否稳定、问题能否复现,同样需要被验证。


基于长期积累的多模态数据生产、数据标注与验证能力,以及在 AI Agent 场景中的实践,文德数慧正在建设面向真实 APP 场景的 RL(强化学习)环境,把任务、环境、数据、执行和评估连接起来,为 Agent 的训练、测试和持续优化提供更接近真实业务的作业底座。



Part.1


Agent 进入真实业务,

数据不再只是“标注答案”


传统数据生产更多解决的是“数据是什么”“答案是什么”。


但 Agent 面对真实 APP 时,问题变了。


一个任务可能从一句自然语言指令开始,经过页面理解、信息判断、路径规划、连续操作,最后还需要确认任务是否真正完成。


这里产生的数据,也不再只是一个静态标签。


它可能包括任务目标、页面状态、操作轨迹、执行结果、异常过程以及最终反馈。对于 Agent 来说,这些信息共同构成了对“如何完成任务”的描述。



我们长期积累的多模态数据生产能力,为这类工作提供了基础。过去在图像、文本、音视频等数据上的生产、标注和质量验证经验,可以继续向 Agent 任务数据延伸。同时,Agent 训练与评估还需要进一步回答:任务怎么执行、过程是否合理、结果怎么验证、反馈如何形成。


而我们的RL 环境建设,正是在补上这一层。



Part.2


我们不只“有数据”,

还有完整的数据生产与验证链路


我们长期服务的 AI 场景,本身就涉及大量非结构化、多模态数据。


图像、文本、音频、视频,以及更复杂的场景数据,需要经过采集、清洗、标注、验证和质量控制,才能真正进入模型训练和应用环节。


Agent 的训练同样离不开数据。但它需要的数据维度更丰富。


除了“看到了什么”,还要知道“应该做什么”;除了“结果是什么”,还要知道“中间发生了什么”;除了“这次是否成功”,还要能够进一步分析“为什么成功”或者“为什么失败”。



这也是我们现有能力向 Agent 场景延伸的基础。


在已有多模态数据能力之上,进一步增加任务设计、环境构建、执行轨迹、结果验证和奖励反馈,数据的作用从单纯支撑模型理解,逐步延伸到支撑 Agent 的行为训练与能力评估。


这不是简单增加一个产品模块。它对应的是数据服务能力的一次变化:从生产训练数据,进一步走向生产可执行、可验证、可反馈的 Agent 任务数据。



Part.3


从任务设计到Pass测试,

形成Agent训练评估的复用基础


围绕真实 APP 场景,我们目前已经建设全链路作业平台,覆盖环境生成、数据生产验证、Pass 测试等关键环节。


任务进入平台后,首先需要解决“能不能稳定运行”。之后还要解决“执行结果能不能判断”。


因此,平台并不只是提供一个运行环境。


从任务设计、环境准备,到执行记录、结果验证,再到日志回看和问题复盘,各环节需要形成相对完整的作业链路。



在实际测试中,我们的团队也在持续沉淀 Agent 问题定位方法,用于分析其在理解、规划和执行不同阶段出现的问题。


这里的核心变化是:交付的不只是“跑过一次的任务”,而是经过生产和验证流程、具备可执行、可观察、可评估条件的任务和数据。


目前,这套方法也已经形成了可复用的作业基础。



Part.4


从数据生产到数据驱动的 Agent 运营


Agent 需要的不只是训练数据,还需要一个能够持续运行、持续反馈、持续验证的环境。


任务在这里被执行,结果在这里被验证,问题被记录下来,新的策略再回来测试。


从数据生产走向任务生产,从结果标注走向过程验证,从一次性交付走向持续反馈。


我们正通过建设RL 环境,为Agent构建起一个能够持续运行、持续验证、持续优化的进化基座,让 Agent 从“能回答”,逐步走向“能执行、能验证、能优化”。


ENTERPRISE



文德数慧

文德数慧是一家专注于让 AI 真正落地的数据基础设施提供商。公司围绕具身智能、大模型与自动驾驶等AI核心场景,提供多模态与高阶数据服务,支撑下一代人工智能系统的训练与进化。