ICLR2027-摘要截止
NeurIPS2026-论文开奖
ICLR2027-正文提交
AAAI2027-反驳开始
AAAI2027-反驳结束
ICLR2027-反驳结束
ICLR2027-反驳开始
AAAI2027-论文开奖
00天 00: 00: 00
00/00
共2058条结果
重置
作者:Chi Zhang, Xiang Zhang, Chenxu Jiang, Gui-Song Xia, Lei Yu
时间:2026
刊物:IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
具有较长曝光时间的基于帧的相机常常会在帧与帧之间产生明显的视觉模糊和信息丢失,从而显著降低视频质量。为了应对这一挑战,我们提出了 EVDI++,这是一个统一的用于基于事件的视频去模糊与插帧的自监督框架,它利用事件相机的高时间分辨率来减轻运动模糊并实现中间帧预测。具体而言,可学习双重积分 (LDI) 网络旨在估计参考帧与清晰隐式图像之间的映射关系。随后,我们通过引入基于学习的分段重建模块来精细化粗糙结果并优化整体训练效率,使得图像能够在不同的曝光时间间隔下进行转换。我们设计了一种自适应无参数融合策略以获得最终结果,该策略利用了并行事件在 LDI 输出中所蕴含的置信度。我们提出了一个自监督学习框架,通过挖掘模糊帧、隐式图像与事件流之间的相互约束,使网络能够使用真实世界的模糊视频和事件进行训练。我们进一步使用 DAVIS346c 相机构建了一个包含真实世界模糊图像和事件的数据集,展示了所提 EVDI++ 在真实场景中的泛化能力。在合成及真实数据集上的广泛实验表明,我们的方法在视频去模糊和插帧任务中均达到了 SOTA (state-of-the-art) 性能。
作者:Yichong Xia, Yimin Zhou, Jinpeng Wang, Mingyao Hong, Haoqian Wang, Bin Chen
在低码率条件下重建高质量图像长期以来一直是一项具有挑战性的任务。先前的研究通过利用扩散模型(diffusion models)的先验知识使这一任务变得可行。然而,在图像压缩任务中,扩散模型基线无法充分整合高级语义信息,且扩散先验与压缩器的学习目标之间也缺乏对齐。为了解决这一问题,我们提出了用于高效低码率图像压缩的扩散先验精炼(DiRIC),一种基于 Stable Diffusion 的图像压缩方案。DiRIC 可以高效地编码低级图像信息,并通过利用高级语义特征和扩散模型固有的先验知识,实现对原始图像的高度逼真重建。具体而言,DiRIC 采用多特征压缩器以极低的码率表示关键的低级信息;同时,它通过预嵌入(pre-embedding)机制获取更鲁棒的混合语义,为解码端提供丰富的上下文支持。此外,我们设计了一个一致性跳跃模块(consistency skip module)来增强和精炼扩散先验。为了进一步提高解码效率,我们利用噪声水平估计器来减少采样步骤,旨在实现高保真度与高效的解码。广泛的实验结果表明,该方法不仅达到了目前最先进的(state-of-the-art)感知保真度,而且在统计保真度方面显著优于以往的感知图像压缩方法。与最先进的扩散基线 [1] 相比,我们在 FID 和 PSNR 方面的 BD Rate 分别实现了 147.44% 和 84.63% 的提升,同时解码速度提高了 19 倍。
作者:Yaowei Li, Yuxuan Bian, Xuan Ju, Zhaoyang Zhang, Junhao Zhuang, Ying Shan
随着基于反转(inversion-based)和基于指令(instruction-based)方法的扩散模型(diffusion models)的发展,图像编辑技术取得了显著进步。然而,当前的基于反转的方法由于反转噪声的结构化特性,难以进行重大修改(例如添加或删除对象),这阻碍了实质性的改变。同时,基于指令的方法通常将用户限制在黑盒操作中,限制了通过直接交互来指定编辑区域和强度。为了解决这些局限性,我们提出了 BrushEdit,一种全新的基于图像修复(inpainting-based)的指令引导图像编辑范式。该范式利用多模态大语言模型(MLLMs)和图像修复模型,实现了自主、用户友好且交互式的自由指令编辑。具体而言,我们设计了一个系统,在智能体协同框架中整合 MLLMs 与双分支图像修复模型,以执行编辑类别分类、主对象识别、掩码获取(mask acquisition)以及编辑区域修复,从而实现自由指令编辑。广泛的实验表明,我们的框架有效地结合了 MLLMs 和修复模型,在包括掩码区域保留和编辑效果连贯性在内的七项指标上取得了优异的性能。
作者:Kanghao Chen, Guoqiang Liang, Yunfan Lu, Hangyu Li, Lin Wang
事件相机(Event cameras)因其高动态范围(HDR)而在低光照视频增强中展现出显著优势。然而,当前的联合研究严重受限于缺乏大规模、真实世界且具备时空对齐的事件-视频数据集。为解决这一问题,我们推出了一个包含超过 30,000 对在不同光照条件下采集的图像帧与事件的大规模数据集。该数据集利用跟踪一致非线性轨迹的机械臂采集,使 90% 的数据集达到了小于 0.03 mm 的空间对齐精度和小于 0.01 s 的时间对齐误差。基于该数据集,我们提出了 EvLight++——一种全新的事件引导低光照视频增强方法,旨在真实场景中实现鲁棒的性能。首先,我们设计了一个多尺度全局融合分支,以整合来自图像和事件的结构与纹理信息。为对抗区域光照变化与噪声的影响,我们引入了信噪比 (SNR) 引导的区域特征选择策略,增强高信噪比区域的特征,并通过从事件中提取结构信息来增强低信噪比区域的特征。为了整合时间信息并确保时间连贯性(temporal coherence),我们进一步在整个流程中引入了循环模块(recurrent module)和时间损失(temporal loss)。在我们自己的数据集以及合成 SDSD 数据集上的广泛实验表明,EvLight++ 相比单张图像和基于视频的方法,分别显着超越了 1.37 dB 和 3.71 dB。为了进一步探索其在语义分割和单目深度估计等下游任务中的潜力,我们通过利用基础模型(foundation models)进行细致的标注,扩展了数据集并添加了伪语义分割与深度标签。在多种低光照场景下的实验表明,增强后的结果在语义分割的 mIoU 上实现了 15.97% 的提升。
作者:Yuqi Jiang, Ying Fu, Qiankun Liu, Jun Zhang
多光谱滤光片阵列 (MSFA) 相机因其紧凑的尺寸和快速的采集速度而被越来越广泛地使用。然而,由于其窄带特性,MSFA 相机经常面临光照不足的问题,拍摄的图像极易被噪声淹没。神经网络作为一种常用的去噪方法,已经展现出取得令人满意去噪结果的强大能力。然而,它们的性能高度依赖于高质量的噪声-清晰图像对。对于 MSFA 图像去噪任务,目前既没有成对的真实数据集,也没有能够生成逼真含噪图像的准确噪声模型。为此,我们提出了一种基于物理的噪声模型,该模型能够匹配真实的噪声分布并合成逼真的含噪图像。在我们的噪声模型中,这些不同类型的噪声可以分为简单分布 (SimpleDist) 分量和复杂分布 (ComplexDist) 分量。前者包含所有可以使用高斯分布或泊松分布等简单概率分布进行描述的噪声类型,而后者则包含无法使用简单概率分布建模的复杂偏色噪声。此外,我们设计了一个噪声解耦网络,由 SimpleDist 噪声消除网络 (SNRNet) 和 ComplexDist 噪声消除网络 (CNRNet) 组成,以顺序消除每个分量。此外,根据我们噪声模型中偏色噪声的不均匀性,我们在 CNRNet 中引入了可学习的位置嵌入来指示位置信息。为了验证我们的物理噪声模型和噪声解耦网络的有效性,我们采集了一个包含成对的长曝光清晰图像和短曝光含噪图像的真实 MSFA 去噪数据集。实验证明,使用我们噪声模型生成的合成数据训练的网络,其性能与使用成对真实数据训练的网络相当,且我们的噪声解耦网络优于其他最先进的去噪方法。
作者:Hansen Feng, Lizhi Wang, Yiqi Huang, Yuzhi Wang, Lin Zhu, Hua Huang
近年来,训练低光照 Raw 图去噪主流的做法已转向采用合成数据。噪声建模专注于刻画真实感光组件的噪声分布,深刻地影响着合成数据的有效性与实用性。目前,基于物理的噪声建模难以刻画完整的真实噪声分布,而基于学习的噪声建模则不切实际地依赖成对的真实数据。本文提出了一种全新的策略:从暗帧(dark frames)而非成对真实数据中学习噪声模型,以打破对数据的依赖。基于这一策略,我们引入了一种高效的物理感知噪声神经网络代理 (PNNP),用以逼近真实感光组件的噪声模型。具体而言,我们将物理先验整合进神经网络代理中,并引入了三项高效技术:物理引导的噪声解耦 (PND)、物理感知代理模型 (PPM) 以及可微分布损失 (DDL)。PND 将暗帧解耦为不同的组成部分,并灵活处理不同层级的噪声,从而降低了噪声建模的复杂度。PPM 结合物理先验来约束合成噪声,提升了噪声建模的准确性。DDL 为噪声分布提供了明确且可靠的监督,提升了噪声建模的精细度。PNNP 在刻画真实噪声分布方面展现出强大的潜力。在公开数据集上的广泛实验表明,该方法在实际低光照 Raw 图去噪中具有优异的性能。源码将公开于 https://fenghansen.github.io/publication/PNNP。
作者:Runmin Cong, Kaisheng Pang, Feng Li, Hua Li, Huihui Bai, Sam Kwong
受限照明条件下以及受限分辨率成像设备拍摄的人脸图像采集,往往会导致光度与几何退化相耦合,表现为低光照和低分辨率 (LLR) 状况。现有研究主要遵循割裂的优化范式,将低光照图像增强 (LLIE) 与人脸超分辨率 (FSR) 视为孤立的任务。这种方法忽视了退化的复合特性,从而显著限制了其在实际场景中的适用性。为了弥合这一差距,我们提出了 DiffLLFace,这是一个统一的框架,利用扩散生成能力与照明感知轨迹,从 LLR 观测中实现鲁棒的 FSR。我们核心的方法在于其交替的照明-扩散适应,它贯穿整个生成过程。该机制不仅能捕获亮度与结构方面的退化模式以协调隐式表示,还能根据扩散模型固有的生成知识动态校准照明先验。因此,DiffLLFace 实现了对条件适应与照明矫正的精确控制。我们还设计了一种简单而有效的非参数傅里叶增强策略,提供结构外观线索,与交替适应协同作用,以确保纹理和颜色的一致性。大量的实验表明,DiffLLFace 优于现有方法,并且在复杂的自然场景中具有显著的泛化能力。代码可在 https://github.com/KaishengPang/DiffLLFace 获取。
作者:Ruixuan Cong, Hao Sheng, Yu Wang, Da Yang, Zhenglong Cui, Weifeng Lyv
近年来,多种基于深度学习的光场图像超分辨率方法取得了显著成功。然而,它们中的大多数都集中在编码器设计上,而忽略了解码器部分中上采样过程的关键作用。受单张图像领域隐式神经网络表示最近进展的启发,我们在本文中精心提出了一种空间-角度-光极平面隐式图像函数 (SAEIIF),它可以重新定义上采样过程,以显著提高性能并实现任意尺度的光场超分辨率。具体而言,它包含两个互补的上采样分支。一个分支结合了空间隐式图像函数 (SIIF) 和角度隐式图像函数 (AIIF),以挖掘子孔径图像中的视角内信息和宏像素中的视角间信息。另一个分支包含光极平面隐式图像函数 (EIIF),以利用光极平面图像中的空间-角度相关性。通过将 SIIF、AIIF 和 EIIF 分解为水平和垂直两步上采样,从而形成上采样尺度的完美匹配,SAEIIF 在两个分支之间引入了多阶段特征交互架构,以充分融合空间、角度和光极平面域信息。此外,我们根据子孔径图像、宏像素和光极平面图像的特征优化了特征采样策略,为 SIIF 和 AIIF 引入了水平-垂直可分离局部采样,并为 EIIF 引入了双源定向线采样。广泛的实验结果表明,我们的 SAEIIF 可以有效地与大多数编码器结合,并在固定尺度和任意尺度的光场空间超分辨率、角度超分辨率以及空间-角度联合超分辨率上均取得了出色的性能。