技术动态 | 时空知识图谱模型设计总结及Step-GUI操作轨迹训练数据合成思路
转载公众号 | 老刘说NLP
继续看技术进展,看两个事情。
一个是Step-GUI中的操作轨迹数据合成思路,这个属于数据合成的范畴,也是当前ui-agent这类模型的重要组成部分。
一个是知识图谱主题,看时空知识图谱(STKGs)模型技术总结,看看怎么从一个静态图谱,逐步变为时间图谱和空间图谱,其有哪些特点,哪些特征。
多总结,多归纳,多从底层实现分析逻辑,会有收获。
一、Step-GUI的操作轨迹数据合成思路
先来看GUI Agent进展,多模态大模型(如Qwen3-VL、Claude4系列)推动GUI自动化发展,具备视觉感知与动作规划能力,但是传统标注成本高、主观性强,多步GUI任务易出现标注错误与幻觉,所以,搞个专门的GUI模型系列。
具体的,可以基于Qwen3-VL做Step-GUI-4B和Step-GUI-8B,技术报告在《Step-GUI Technical Report》,https://arxiv.org/pdf/2512.15431,https://opengelab.github.io/,https://github.com/stepfun-ai/gelab-zero,https://huggingface.co/stepfun-ai/GELab-Zero-4B-preview。
对于这个任务,先对GUI的自动化进行建模,其实际上是关于元组(Q,A,S,O)的序列决策问题。其中:
任务空间Q描述用户意图的自然语言指令集合(例如,“检查电池电量并发送到社交媒体。”),每个任务实例表示为𝑞∈Q;
动作空间A为基于GUI的动作,包括点击、滚动、滑动、输入以及其他界面交互。这些动 作仅通过视觉理解来执行,不依赖于结构化的可访问性信息;
状态空间S表示GUI环境的视觉状态,以每个时间步的屏幕捕获表示;
观测空间O表当前界面的截图,以及任务指令和历史交互日志。
而基于这5个要素,其实可以进行数据合成,下面来看看。
1、数据合成思路
数据合成这块的核心是CSRS(Calibrated Step Reward System,校准步骤奖励系统),流程是“Rollout(轨迹生成)→CSRS 处理→Training(模型训练)” 。

细分步骤如下:
step1.生成原始操作轨迹(Rollout),让当前版本的Step-GUI模型(如迭代N轮的模型M)在GUI环境中自主执行任务(如“用美团订奶茶”),生成大量“原始操作轨迹”。
每条轨迹包含连续的界面截图、模型预测的操作(如点击坐标、滑动方向)、以及模型的初步推理(如“因为要选规格,所以点击‘规格’按钮”),但是部分能成功完成任务(成功轨迹),部分会因操作错误失败(失败轨迹);

step2.轨迹校准(Calibration Layer),通过“自动化验证脚本”或“人工快速判断”,对每条原始轨迹进行“二元标注”,要么“任务成功”(如订单确实提交),要么“任务失败”(如停留在错误界面),若模型生成的“订奶茶”轨迹最终显示“订单提交成功”,则校准为“成功轨迹”,若轨迹卡在“支付页面闪退”,则校准为“失败轨迹”;
step3.多维度数据提取(DataExtraction Module),利用大模型(如Qwen3-VL、Claude4)作为“思考模型(ThinkingModel)”,基于校准后的轨迹标签,自动生成7类结构化训练数据,对“成功轨迹”和“失败轨迹”采用不同的数据提取逻辑,成功轨迹提取全部7类数据,失败轨迹仅提取前6类。
第1-6类是知识类数据帮助模型理解GUI界面语义、任务逻辑和用户意图;第7类是动作类数据,帮助模型提升操作精准度(如点击坐标、滑动幅度)。
这个细分看7类数据。
【1.进度跟踪(ProgressTrack)】记录轨迹中每一步“任务完成度”(如“订奶茶:已选商品→未选规格→未支付”);
【2.状态总结(StateSummary)】用文字描述每一步的界面状态(如“当前页面是奶茶规格选择页,有‘三分糖’‘全糖’等选项”);
【3.效果预测(Effect Prediction)】预测当前操作会带来的界面变化(如“点击‘三分糖’后,规格会显示‘三分糖’,下一步可点击‘加入购物车’”);
【4.自我反思(Self-Reflection)】分析操作的合理性(如“选择‘三分糖’是因为用户可能偏好低糖,符合常见需求”);
【5.状态验证(State Verify)】验证当前界面状态是否符合任务预期(如“当前页面显示‘规格已选择’,符合下一步加入购物车的条件”);
【6.意图执行(IntentExecution)】关联“用户意图”与“操作序列”(如“用户‘订奶茶’的意图,对应‘选商品→选规格→支付’的操作序列”);
【7.动作预测(ActionPrediction)】精准标注具体操作参数(如“点击坐标(x=300,y=500)的‘加入购物车’按钮”“向上滑动500像素”)。
step4.将CSRS提取的7类结构化数据,输入到下一轮模型训练中期训练和后期训练。

2、合成后的数据样式
上面,挖掘到了7类数据,可以对这7类数据进行转换,形成一些具体任务,拆开看具体样例。

1)中期训练(Mid-Train)数据集
数据量~11.2M,以“通用能力+基础GUI技能”为核心,含6类子数据。
拆开来看,包括:
1.通用多模态数据(1.9M),格式(文本/图像输入,自然语言输出) ,如(一张风景图,“这是一片绿色的森林,有河流穿过”),用于保留语言流畅度和基础多模态推理能力;
2.知识密集数据(2M),格式(知识问题/图像,结构化答案) ,如(“购物APP中‘购物车’图标的功能是什么?”,“存储待购买商品,支持数量修改和删除”),用于强化世界知识和GUI领域常识;
3.grounding数据(2.7M),格式(GUI截图+目标描述,像素级定位标注) ,如(美团APP截图+“点击‘外卖’按钮”,坐标(x=200,y=300)+按钮区域boundingbox),用于训练UI元素定位精准度;
4.动作对齐数据(170K),格式(自然语言指令,原子动作参数) ,如(“搜索‘奶茶’”,动作类型=TYPE+内容=“奶茶”+输入框坐标(x=400,y=100)),用于建立“指令→动作”的直接映射;
5.轨迹数据(4M),格式(任务指令+多步GUI截图序列,多步动作序列+推理逻辑) ,如(“订奶茶”+[首页截图→搜索结果截图→规格选择截图],[(CLICK,x=300,y=200)→(TYPE,“奶茶”)→(CLICK,x=500,y=400)]+“先点击搜索框,输入关键词,再选择目标店铺”),用于训练多步任务规划能力。
2)冷启动(Cold-Start)数据集
数据量~1.67M,格式更侧重知识注入和错误修正。细分看数据样式:
1.知识数据(864K),格式(错误场景描述+GUI截图,VQA问答对) ,如(“找不到外卖APP的‘隐藏优惠’按钮”+APP截图,问题=“外卖APP中‘隐藏优惠’入口在哪里?”+答案=“在‘我的’页面下拉触发”),针对性填补模型知识盲区;
2.轨迹数据(404K),格式(任务指令+多步GUI截图序列,高质量动作序列+错误反思) ,如(“买火车票”+[12306截图序列],动作序列+“之前失败是因为未选择乘车人,需在支付前补充”),用于优化执行行为,避免重复错误;
3.通用多模态/Grounding数据(共406K) ,格式与中训练一致,仅数据量更小,用于保留基础能力。
二、时空知识图谱(STKGs)模型技术总结
我们接着看知识图谱的话题,关于时空知识图谱(STKGs)模型,核心围绕STKGs的起源、建模维度、应用场景及现存挑战进行总结。
文章在《Survey on Spatio-Temporal Knowledge Graph Models》,https://arxiv.org/pdf/2512.16487,从应用上看,可用于交通流量预测、森林火灾预警、人类轨迹预测、医疗影像分析、城市 mobility 预测等。
有趣的是,可以看看其中从简单的图结构开始,如何逐步加入不同的元素,逐步变成一个复杂的时空知识图谱。


1、静态图谱模型
对于静态图谱模型,简单图定义为G=(V,E),V为节点集,E为无向边集(无时空信息)。可以扩展为含directedgraph(有向边)、multigraph(多重边)、labeledgraph(节点/边标注)等,也就是变成属性图(含节点/边标签与属性)、RDF图(含顶点/边标注函数)。
2、时间图谱模型
对于时间图谱模型,存在14种相关术语(如temporalgraph、dynamicnetworks等),无统一标准。

边方向可分为有向、无向、混合,有向边占比最高。
时间标注可以分为节点级、边级、节点-边级、图级,边级或节点-边级标注为主。

时间语义分为时长、区间、时间戳,离散时间戳占主导。

3、空间图谱模型
对于空间图谱模型,多以应用场景命名(如geospatialnetwork、trafficnetwork等)。

在边形成上,包括显式定义、推断(距离阈值等)、混合,但显式边为主,部分结合距离推断。
在空间标注上,包括节点级、节点-边级、图级,节点级标注占绝对主导。

在节点维度上,包括0维(点)、2维(区域/多边形),0维节点为主。

4、时空知识图谱
给出了一个构建指南,建模指南包含5个核心步骤,有几个关键的决策点。

依次排列下来就是:
确定边形成方式:选择有向/无向边,明确边为显式定义或推断生成;
选择时间标注位置:节点级、边级、节点-边级或图级;
选择空间标注位置:节点级、节点-边级或图级;
确定时间语义:离散时间戳、连续区间或时长(多与前两者组合使用);
设定节点空间维度:0维点或2维区域。
参考文献
1、https://arxiv.org/pdf/2512.15431
2、https://arxiv.org/pdf/2512.16487
OpenKG
OpenKG(中文开放知识图谱)旨在推动以中文为核心的知识图谱数据的开放、互联及众包,并促进知识图谱算法、工具及平台的开源开放。

点击阅读原文,进入 OpenKG 网站。
更多推荐
所有评论(0)