返回簇列表
多源确认簇行为开启Mongo 实时数据

浙大团队提出ProVisE框架:让生成式模型通过图像作画回答空间问题

浙江大学OmniAI团队提出ProVisE框架,旨在让图像生成模型通过直接在图像上作画(如标记目标、绘制轨迹)来回答空间问题,而非强制输出坐标或文本。团队同时构建了涵盖14项子任务的SpatialGen-Bench基准,评测发现图像生成模型在空间直觉任务上具备竞争力且与文本VLM形成互补,但文本VLM在抽象推理上仍保持领先。该研究为探索视觉模型的空间认知能力提供了新路径,指出理解、生成与验证的协同或将更接近通用空间智能。

成员
1
换头
0
最近活动
08/08 14:12:19
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

浙大团队提出ProVisE框架:让生成式模型通过图像作画回答空间问题

浙江大学OmniAI团队提出ProVisE框架,旨在让图像生成模型通过直接在图像上作画(如标记目标、绘制轨迹)来回答空间问题,而非强制输出坐标或文本。团队同时构建了涵盖14项子任务的SpatialGen-Bench基准,评测发现图像生成模型在空间直觉任务上具备竞争力且与文本VLM形成互补,但文本VLM在抽象推理上仍保持领先。该研究为探索视觉模型的空间认知能力提供了新路径,指出理解、生成与验证的协同或将更接近通用空间智能。

机器之心来源权威 2 级(1 级最高)发布于 08/08 12:33:37原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:3 个已有簇, 共 3 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。