虚拟现实 维基百科,自由的百科全书

7748

【速读】:该论文旨在解决当前多模态大语言模型(Multimodal Large Language Models, MLLMs)在理解全景图像(Omnidirectional Images, ODIs)所捕获的沉浸式环境方面能力不足的问题。 ODIs 提供了 360°×180° 的全向视野,广泛应用于虚拟现实(VR)、增强现实(AR)和具身智能(Embodied Intelligence)等场景,但现有 MLLMs 在此类复杂空间信息的理解上表现有限。 为填补这一空白,作者提出了 ODI-Bench——一个包含 2000 张高质量 ODIs 和超过 4000 对人工标注问答对的综合性基准,涵盖 10 个细粒度任务,覆盖一般层面与空间层面的理解需求。

关键创新包括:1)提出SAgoge,目前最大且最全面的多模态SVG数据集,涵盖静态图形与动态动画,支持多样化任务;2)设计SArena基准测试体系,提供标准化评估与任务定义;3)开发InternSVG模型,采用SVG专用特殊标记、基于子词的嵌入初始化及两阶段训练策略,从简单静态SVG逐步过渡到复杂长序列图示与动画,实现正向迁移并显著提升性能。 【速读】:该论文旨在解决自动驾驶场景中3D目标检测任务面临的两个核心问题:一是多模态方法在特征对齐上的困难,二是仅依赖局部特征提取难以应对复杂场景下的检测需求。 其解决方案的关键在于提出一种名为NV3D的新模型,该模型通过基于K近邻(KNN)和主成分分析(PCA)的体素法向量计算机制,从体素邻域中获取具有几何结构信息的局部特征,从而增强模型对物体表面与目标实体(如车辆、行人或骑行者)之间关系的理解能力。 此外,NV3D引入两种采样策略(基于法向量密度的采样和视野感知的分箱采样),可在保留性能的前提下减少高达55%的数据量,并结合元素级注意力融合机制,将体素特征作为查询和值,法向量特征作为键进行特征融合,显著提升了检测精度,尤其在KITTI数据集上实现了优于基线Voxel R-CNN的mAP表现。 【速读】: 该论文旨在解决大语言模型(Large-Language Model, LLM)在推理能力、对齐性(alignment)和鲁棒性(robustness)之间难以协同提升的问题。 传统方法常依赖奖励模型或复杂的多目标优化,导致训练不稳定或性能瓶颈。 此外,文中设计了针对匹配负样本的infoNCE指标(如 Sufficiency Index, SI),用于量化CoT对政策的编码强度,从而在训练前筛选高价值原则,显著改善小规模模型(1B参数)的训练稳定性和下游任务表现,验证了推理、对齐与鲁棒性可统一为单一信息几何目标的假设。 【速读】: 该论文旨在解决当前基于logit的知识蒸馏(Knowledge Distillation, KD)方法在压缩大语言模型(Large-Scale Language Models, LLMs)时存在的局限性,即静态策略无法适配学生模型动态学习过程的问题。

基于此洞察,作者提出RALI算法,利用对比学习直接将图像对齐至由RL学习到的通用文本表征,从而无需依赖推理过程或加载大型语言模型(LLM),在保持与推理模型相当的泛化性能的同时,模型参数量和推理时间均减少至不足5%。 【速读】:该论文旨在解决内河航道海域态势感知(Maritime Domain Awareness, MDA)中因依赖合作式系统(如自动识别系统,AIS)而存在的漏洞问题。 传统AIS监测易受船舶关闭信号或未装备设备的影响,导致”暗船”(dark vessels)难以被发现,从而削弱了对航行活动的全面掌握。 解决方案的关键在于融合非合作式的高分辨率卫星遥感影像与AIS轨迹数据,通过YOLO v11目标检测模型实现对船只类型、舱盖状态、作业状态、驳船数量及航向的精准识别,并利用多源数据关联分析实现对暗船的识别、合作船舶的验证以及高级MDA支持。 该方法显著提升了内河航运监管的完整性与实时性,且在不同地理段落间具有良好的空间迁移能力(准确率高达98%)。 【速读】:该论文旨在解决扩散 Transformer (Diffusion Transformers, DiTs) 在视觉生成过程中局部细节合成质量不足的问题。 尽管 DiTs 已成为强大的生成骨干模型,但其内部特征图中存在大量激活(Massive Activations, MAs),这些激活的具体作用尚不明确。

我们推测,在观看不同视觉模式的VR影片时,被试者会产生差异较大的高级认知活动,总体来说,β波段分类效果较好,观看VR-3D影片时,被试者的注意力更加集中。 该分类结果与客观数据分析结论相匹配,印证了β波段的脑电信号可以作为分辨VR-2D和VR-3D两种视觉模式的有用指标,脑电信号在该波段产生了更大的差异。 综上所述,VR-3D模式下的β波段脑电能量显著高于VR-2D模式。 Β波被认为是测量认知和情绪过程的有用指标,将脑电信号中的β波节律用于情感状态识别是可行的[35],β波的活动与唤醒状态有关[12],然而β波的脑电活动也能很好地反馈视觉注意处理活动[36]。 本实验中,VR-3D模式下被试者β波活动更加活跃,与VR-2D模式下的β波能量产生了显著差异,这一差异可能是由唤醒度的上升造成的,但在立体视觉模式下被试者的注意力更加集中[32],β波的活跃也有可能是由视觉模式的不同带来的注意力集中度不同引起的,因此,未来的研究中可以增加对唤醒度和电生理研究结果的相关分析,以进一步明确这种生理反应和唤醒度之间的关系。 本次实验选取人脑的五个脑区(额区、中央区、顶区、颞区、枕区)的通道作为特征识别通道,利用训练集数据进行训练,并用测试集数据进行验证,检验不同脑区对VR-2D和VR-3D视觉模式的分类识别准确率。

解决方案的关键在于提出一种称为TypePilot的代理式人工智能框架,该框架通过引入强类型且可验证的语言(以Scala为例),并结合形式化验证工具(如Stainless)与结构化的类型引导工作流,显著降低输入验证和注入类漏洞的风险,从而提升LLM生成代码的安全性与鲁棒性。 你在左边看到,世界上第一个空军头戴式显示器和对一只眼睛的虚拟投影,让它在光学无限远处投射30度视场角的虚拟图像。 无论您将头部和 光学无限远处的位置移动到现实世界、目标或区域的哪个位置,您都将在该头盔上进行三角测量,并确定您正在寻找的相对于驾驶舱的位置。 所以现在我们有能力拥有一个虚拟显示器的移动设备,并且实际上知道该显示器相对于现实世界的位置。 在这个世界上,我们将如何最终建立一个驾驶舱,将飞行员的意识与我们的视觉、听觉和触觉紧密耦合的想法,以获得三维信息,以帮助飞行员获得更高的处理带宽。 为了演示这一点,在70年代末和80年代初开始,我开发了这个模拟器,我们称之为Darth Vader模拟器。 这样做的目的是让我们用两只眼睛和一个16位电磁跟踪系统为我们提供 120 度的瞬时视野,这将使我们获得环绕的体验。

其解决方案的关键在于提出一个名为MATH-Beyond(MATH-B)的新基准测试集,该基准专为挑战主流开源模型(如8B参数规模)设计,即使在大规模采样(例如pass@1024)条件下仍能保持高难度,从而迫使RL方法探索超出基础模型能力的新推理路径。 实验证明,当前主流RL微调模型在该基准上表现不佳,凸显了现有方法的局限性,并推动开发更具探索性的RL策略以激发更深层次的数学推理能力。 【速读】:该论文旨在解决大型视觉语言模型(Large Vision-Language Models, LVLMs)在图表推理任务中对分布外(out-of-distribution, OOD)数据鲁棒性不足,且生成链式思维(chain-of-thought, CoT)解释时性能进一步下降的问题,从而限制了模型的可解释性和实际应用可信度。 解决方案的关键在于提出 Chart-RVR 框架,该框架通过结合组相对策略优化(Group Relative Policy Optimization, GRPO)与自动可验证奖励机制,设计三种目标驱动的奖励信号:(i) 正确的图表类型分类、(ii) 忠实的表格结构重建、(iii) 推理过程的一致性,从而在保持高准确率的同时显著提升 CoT 理由的忠实度与可解释性,使模型在分布内和分布外场景下均达到最优表现。 【速读】:该论文旨在解决现代视觉语言模型(Vision Language Models, VLMs)在组合推理(compositional reasoning)方面的固有缺陷,即当任务依赖于理解图像中多个对象、属性与关系之间的交互时,VLMs 常常表现不佳。 解决方案的关键在于提出一种名为 COCO-Tree 的新方法,该方法通过从大型语言模型(Large Language Models, LLMs)中学习得到的神经符号概念树(neurosymbolic concept trees)来增强 VLM 的输出,从而提升其语言推理能力。 COCO-Tree 采用受束搜索(beam search)启发的推理过程,在不增加显著计算开销的前提下,不仅显著提升了组合泛化性能(在四个基准测试上提升 5–10%),还提供了可解释的推理路径,增强了模型预测的透明性。 【速读】:该论文旨在解决视频中人体姿态估计(VHPE)任务中高分辨率时空表征建模的难题,特别是如何有效平衡全局动态上下文(如整体人体运动趋势)与局部运动细节(如关键点的高频变化)的建模问题。 现有方法通常采用单一结构(卷积或注意力机制)统一处理时空学习,难以兼顾两者且存在计算复杂度高的缺陷,尤其在高分辨率序列中难以捕捉全局依赖关系。

通过蒸馏来自已水印教师模型的知识,攻击者能够窃取并复制受害模型的水印信号,从而生成看似来自可信源的伪造内容,实现对有害信息(如虚假信息)的无缝误标。 这一发现揭示了现有文本归属验证机制的重大安全缺陷,并呼吁转向具备区分真实水印与高超仿制品能力的新一代技术。 【速读】:该论文旨在解决生理信号(physiological signal)医疗应用中因硬件限制或运动伪影导致的多模态数据缺失问题,此类缺失常使现有方法性能显著下降。 解决方案的关键在于提出PhysioME框架,其核心包括:(1) 一种结合对比学习与掩码预测的多模态自监督学习策略,以增强模型对不完整输入的鲁棒性;(2) 专为捕捉各生理信号模态时序动态设计的Dual-PathNeuroNet主干网络;(3) 一个恢复解码器,用于重建缺失模态的token,从而实现对不完整输入的灵活处理。 【速读】:该论文旨在解决当前基于强化学习(Reinforcement Learning, RL)的大型语言模型(Large Language Models, LLMs)在数学推理任务中陷入”能力 plateau”的问题,即现有RL方法主要通过优化已有解题模式而非发现新的推理策略,导致性能提升有限。

SAM量表中相同模式下不同情绪影片的主观效价、唤醒、控制数据结果表明,VR-2D和VR-3D模式下正性材料效价显著高于负性材料;VR-3D模式下正负性影片无显著的唤醒度差异,VR-2D模式下存在显著的唤醒度差异。 该结果表明,被试者能够清楚地分辨被试材料的情感意义,且实验选用的正负性视频材料都可以引发较高的唤醒度。 此外,对于两部影片VR-2D和VR-3D模式间的效价、唤醒指标的主观评分并未产生显著差异,表明被试者在SAM评价上并未表现出两种视觉模式的情绪维度差异。 在少数几篇文献中,研究者发现相较于VR-2D显示技术,VR-3D显示技术可以带来更高的存在感,而且这种主观体验与脑电活动呈现显著相关性[14-15]。 Slobounov等[15]的研究还发现,在空间导航任务执行过程中,VR-3D环境能够提高知觉运动任务的成功率,被试者额区θ波段的脑电信号能量显著高于VR-2D环境。 近年来,虚拟现实(virtual reality,VR)影像备受瞩目,VR凭借其特有的沉浸感、交互性等特点,给观众带来了别样的观影体验。 VR场景显示方式有头盔式、桌面式、投影式等,其中,头盔式是较为常用的虚拟场景显示方式[1]。 与传统影像一样,VR影像也有非立体(two-dimensional,2D)和立体(three-dimensional,3D)之分。

【速读】: 该论文旨在解决传统序列模型在token-level分类任务中对长距离依赖关系建模不足的问题,尤其在越南语领域中,如命名实体识别(Named Entity Recognition, ASIAN ANAL PORN CLIPS NER)和言语不流畅检测等任务中,仅依赖自回归或卷积结构难以充分捕捉词元间的复杂语义关联。 解决方案的关键在于提出TextGraphFuseGAT模型,该模型将预训练Transformer编码器(PhoBERT)与图注意力网络(Graph Attention Networks, GAT)相结合:首先利用PhoBERT生成初始token嵌入,随后构建一个全连接图以显式建模token之间的非局部依赖关系;在此基础上引入Transformer风格的自注意力机制进一步增强上下文表示能力,最终通过分类头实现精准序列标注。 该架构有效融合了预训练语义特征与图结构关系建模优势,在多个越南语基准数据集上显著优于纯Transformer及混合神经网络基线模型。 【速读】: 该论文旨在解决现有大语言模型(Large Language Models, LLMs)文化适应性评估基准与实际跨文化对话场景脱节的问题。

到1994年7月,世嘉已经在欢乐城室内主题公园推出了VR-1(英语:VR-1)动态模拟器游乐设施[27],以及电脑戦记街机游戏。 两者均使用了一种先进的头戴式显示器,被称为与Virtuality合作开发的”Mega Visor Display”;;[28][29]它能够在360度立体3D环境中追踪头部运动,由Sega Model 1街机系统板供电。 [30]苹果则推出了QuickTime VR,虽然使用了”VR”一词,但无法表示虚拟实境,而是显示360度互动全景。 用户可以观看、制作可拖拽的全景照片,并通过在不同角度拍摄的图像来观察物体。

Ask ChatGPT
Set ChatGPT API key
Find your Secret API key in your ChatGPT User settings and paste it here to connect ChatGPT with your Tutor LMS website.