虚拟现实:从阿凡达到永生_百度百科
该方法在多个数据集上达到SOTA性能,尤其在Visa数据集上F₁-max和AP指标分别提升10.3%和7.7%。 【速读】:该论文旨在解决当前端到端自动驾驶方法在决策过程中对场景动态演化关注不足的问题,这类方法通常采用”一次性”(one-shot)范式,仅依赖当前场景上下文进行动作预测,从而难以在复杂驾驶场景中做出适应性与前瞻性更强的决策。 解决方案的关键在于提出SeerDrive框架,其核心创新是通过闭环方式联合建模未来场景演化与轨迹规划:一方面利用预测的鸟瞰图(BEV)表示提前感知环境动态变化,另一方面将此先验信息注入轨迹规划模块以生成更具前瞻性的路径;具体由两个关键组件实现——未来感知规划(future-aware planning)和迭代式场景建模与车辆规划协同优化,从而显著提升模型在真实复杂交通场景中的决策能力。 ODIs 提供了 360°×180° 的全向视野,广泛应用于虚拟现实(VR)、增强现实(AR)和具身智能(Embodied Intelligence)等场景,但现有 MLLMs 在此类复杂空间信息的理解上表现有限。 为填补这一空白,作者提出了 ODI-Bench——一个包含 2000 张高质量 ODIs 和超过 4000 对人工标注问答对的综合性基准,涵盖 10 个细粒度任务,覆盖一般层面与空间层面的理解需求。 实验表明,主流 MLLMs 在 ODIs 上的表现仍存在显著局限。 为此,论文进一步提出 Omni-CoT,一种无需训练的方法,通过跨文本信息与视觉线索的链式思维(Chain-of-Thought, CoT)推理机制,显著提升 MLLMs 对全景环境的理解能力。 其关键创新在于利用 CoT 推理框架实现对 ODI 中空间结构和语义内容的协同解析,从而增强模型在沉浸式场景下的推理能力。 【速读】:该论文旨在解决视障或低视力(Blind or Low Vision, LESBIAN PORN SEX VIDEOS BLV)人群在极端或复杂环境中的行走辅助难题,其核心瓶颈在于缺乏对场景的全局理解能力。 为应对这一挑战,作者提出了一种名为mmWalk的模拟多模态数据集,其关键创新在于整合了多视角传感器信息与面向无障碍通行的特征,涵盖120条人工控制的、按场景分类的行走轨迹,共62,000帧同步数据及超过559,000张RGB、深度和语义模态的全景图像,并特别包含室外典型边缘案例和BLV用户专属地标。 此外,研究构建了mmWalkVQA视觉问答基准(含69,000余个三元组),用于评估模型在风险识别与导航决策上的表现,实验表明当前最先进的视觉语言模型(Vision-Language Models, VLMs)在零样本和少样本设置下仍存在显著性能不足,而基于mmWalk微调后的模型在真实世界数据上展现出更强的实用性,验证了该数据集在推动多模态行走辅助技术发展方面的有效性。 【速读】: 该论文旨在解决检索增强生成(Retrieval-Augmented Generation, RAG)中一个关键问题:现有方法通常将检索到的文本片段视为通用”有用性”(utility),忽视了不同大语言模型(Large Language Models, […]
