ICLR2027-摘要截止
NeurIPS2026-论文开奖
ICLR2027-正文提交
AAAI2027-反驳开始
AAAI2027-反驳结束
ICLR2027-反驳结束
ICLR2027-反驳开始
AAAI2027-论文开奖
00天 00: 00: 00
00/00
共2060条结果
重置
作者:Sangwoo Jo, Donggeun Ko, Jayeon Kang, Youngsang Kwak, Jaehwa Kwak, Sungjoon Choi
时间:2026
刊物:European Conference on Computer Vision (ECCV)
图像复原根本上受制于失真与感知之间的权衡:最小化像素级误差会导致过度平滑的结果,而针对感知真实度进行优化则常常引入结构偏差。近期的方法尝试通过后验采样或多阶段生成流水线来平衡这一权衡,但其计算开销依然昂贵且架构复杂。为了克服这些局限性,我们提出了 PCFlow(感知一致流匹配),这是一个统一的框架,可将从退化观测到清晰目标的连续传输过程直接参数化,从而联合优化失真与感知质量。在其隐式一致性流目标的驱动下,模型能够实现稳定且高效的少步推断;同时,隐式一致性感知损失 (LCPL) 直接对引导速度场施加语义约束,引导动态过程走向视觉上清晰的数据流形。此外,注意到结构一致性与感知一致性之间的内在冲突,我们引入了一种无冲突梯度投影策略来稳定多目标优化格局。结合轻量化的纯卷积主干网络,PCFlow 在多种复原任务中取得了具备竞争力的性能,而计算成本仅为传统方法的一小部分。
作者:Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin
近期,基于扩散模型的方法在图像去雾方面取得了显著进展。然而,它们通常忽略了成雾的物理学规律,而是直接从纯高斯噪声中重建清晰图像,从而限制了其复原潜力。为了解决这一问题,我们提出了雾-噪声扩散模型 (HNDiff),这是一种将大气散射模型作为归纳偏置(inductive bias)嵌入的新型扩散框架。通过将扩散过程建立在物理原理之上,HNDiff 确保了图像复原能够更紧密地契合雾形成的底层机制。在其前向过程中,我们引入了带有雾感知噪声调度器的联合雾-噪声扩散,该调度器能够逐步向图像中同时添加雾和噪声。从本质上讲,该调度器根据雾的密度来自适应调整噪声水平:这意味着雾气较重的区域会接受更强的噪声注入以促进内容生成,而较清晰的区域则接受较轻的噪声以更好地保留细节,从而将前向退化过程与雾的物理特性直接联系起来。在反向过程中,我们推导出了一个物理上一致的去雾-去噪过程,该过程能以与前向退化过程相匹配的方式,同时消除雾和噪声以复原清晰图像。为了进一步提升实用性,我们提出了 Latent HNDiff,它能够汇编清晰的隐式先验(latent priors),并可无缝整合到现有的去雾网络中以提升性能。广泛的实验表明,我们的工作显著提升了主流去雾主干网络的性能,并在基准数据集上达到了最先进的(state-of-the-art)结果。项目页面见此链接。
作者:Chi Zhang, Xiang Zhang, Chenxu Jiang, Gui-Song Xia, Lei Yu
刊物:IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
具有较长曝光时间的基于帧的相机常常会在帧与帧之间产生明显的视觉模糊和信息丢失,从而显著降低视频质量。为了应对这一挑战,我们提出了 EVDI++,这是一个统一的用于基于事件的视频去模糊与插帧的自监督框架,它利用事件相机的高时间分辨率来减轻运动模糊并实现中间帧预测。具体而言,可学习双重积分 (LDI) 网络旨在估计参考帧与清晰隐式图像之间的映射关系。随后,我们通过引入基于学习的分段重建模块来精细化粗糙结果并优化整体训练效率,使得图像能够在不同的曝光时间间隔下进行转换。我们设计了一种自适应无参数融合策略以获得最终结果,该策略利用了并行事件在 LDI 输出中所蕴含的置信度。我们提出了一个自监督学习框架,通过挖掘模糊帧、隐式图像与事件流之间的相互约束,使网络能够使用真实世界的模糊视频和事件进行训练。我们进一步使用 DAVIS346c 相机构建了一个包含真实世界模糊图像和事件的数据集,展示了所提 EVDI++ 在真实场景中的泛化能力。在合成及真实数据集上的广泛实验表明,我们的方法在视频去模糊和插帧任务中均达到了 SOTA (state-of-the-art) 性能。
作者:Yichong Xia, Yimin Zhou, Jinpeng Wang, Mingyao Hong, Haoqian Wang, Bin Chen
在低码率条件下重建高质量图像长期以来一直是一项具有挑战性的任务。先前的研究通过利用扩散模型(diffusion models)的先验知识使这一任务变得可行。然而,在图像压缩任务中,扩散模型基线无法充分整合高级语义信息,且扩散先验与压缩器的学习目标之间也缺乏对齐。为了解决这一问题,我们提出了用于高效低码率图像压缩的扩散先验精炼(DiRIC),一种基于 Stable Diffusion 的图像压缩方案。DiRIC 可以高效地编码低级图像信息,并通过利用高级语义特征和扩散模型固有的先验知识,实现对原始图像的高度逼真重建。具体而言,DiRIC 采用多特征压缩器以极低的码率表示关键的低级信息;同时,它通过预嵌入(pre-embedding)机制获取更鲁棒的混合语义,为解码端提供丰富的上下文支持。此外,我们设计了一个一致性跳跃模块(consistency skip module)来增强和精炼扩散先验。为了进一步提高解码效率,我们利用噪声水平估计器来减少采样步骤,旨在实现高保真度与高效的解码。广泛的实验结果表明,该方法不仅达到了目前最先进的(state-of-the-art)感知保真度,而且在统计保真度方面显著优于以往的感知图像压缩方法。与最先进的扩散基线 [1] 相比,我们在 FID 和 PSNR 方面的 BD Rate 分别实现了 147.44% 和 84.63% 的提升,同时解码速度提高了 19 倍。
作者:Yaowei Li, Yuxuan Bian, Xuan Ju, Zhaoyang Zhang, Junhao Zhuang, Ying Shan
随着基于反转(inversion-based)和基于指令(instruction-based)方法的扩散模型(diffusion models)的发展,图像编辑技术取得了显著进步。然而,当前的基于反转的方法由于反转噪声的结构化特性,难以进行重大修改(例如添加或删除对象),这阻碍了实质性的改变。同时,基于指令的方法通常将用户限制在黑盒操作中,限制了通过直接交互来指定编辑区域和强度。为了解决这些局限性,我们提出了 BrushEdit,一种全新的基于图像修复(inpainting-based)的指令引导图像编辑范式。该范式利用多模态大语言模型(MLLMs)和图像修复模型,实现了自主、用户友好且交互式的自由指令编辑。具体而言,我们设计了一个系统,在智能体协同框架中整合 MLLMs 与双分支图像修复模型,以执行编辑类别分类、主对象识别、掩码获取(mask acquisition)以及编辑区域修复,从而实现自由指令编辑。广泛的实验表明,我们的框架有效地结合了 MLLMs 和修复模型,在包括掩码区域保留和编辑效果连贯性在内的七项指标上取得了优异的性能。
作者:Kanghao Chen, Guoqiang Liang, Yunfan Lu, Hangyu Li, Lin Wang
事件相机(Event cameras)因其高动态范围(HDR)而在低光照视频增强中展现出显著优势。然而,当前的联合研究严重受限于缺乏大规模、真实世界且具备时空对齐的事件-视频数据集。为解决这一问题,我们推出了一个包含超过 30,000 对在不同光照条件下采集的图像帧与事件的大规模数据集。该数据集利用跟踪一致非线性轨迹的机械臂采集,使 90% 的数据集达到了小于 0.03 mm 的空间对齐精度和小于 0.01 s 的时间对齐误差。基于该数据集,我们提出了 EvLight++——一种全新的事件引导低光照视频增强方法,旨在真实场景中实现鲁棒的性能。首先,我们设计了一个多尺度全局融合分支,以整合来自图像和事件的结构与纹理信息。为对抗区域光照变化与噪声的影响,我们引入了信噪比 (SNR) 引导的区域特征选择策略,增强高信噪比区域的特征,并通过从事件中提取结构信息来增强低信噪比区域的特征。为了整合时间信息并确保时间连贯性(temporal coherence),我们进一步在整个流程中引入了循环模块(recurrent module)和时间损失(temporal loss)。在我们自己的数据集以及合成 SDSD 数据集上的广泛实验表明,EvLight++ 相比单张图像和基于视频的方法,分别显着超越了 1.37 dB 和 3.71 dB。为了进一步探索其在语义分割和单目深度估计等下游任务中的潜力,我们通过利用基础模型(foundation models)进行细致的标注,扩展了数据集并添加了伪语义分割与深度标签。在多种低光照场景下的实验表明,增强后的结果在语义分割的 mIoU 上实现了 15.97% 的提升。
作者:Yuqi Jiang, Ying Fu, Qiankun Liu, Jun Zhang
多光谱滤光片阵列 (MSFA) 相机因其紧凑的尺寸和快速的采集速度而被越来越广泛地使用。然而,由于其窄带特性,MSFA 相机经常面临光照不足的问题,拍摄的图像极易被噪声淹没。神经网络作为一种常用的去噪方法,已经展现出取得令人满意去噪结果的强大能力。然而,它们的性能高度依赖于高质量的噪声-清晰图像对。对于 MSFA 图像去噪任务,目前既没有成对的真实数据集,也没有能够生成逼真含噪图像的准确噪声模型。为此,我们提出了一种基于物理的噪声模型,该模型能够匹配真实的噪声分布并合成逼真的含噪图像。在我们的噪声模型中,这些不同类型的噪声可以分为简单分布 (SimpleDist) 分量和复杂分布 (ComplexDist) 分量。前者包含所有可以使用高斯分布或泊松分布等简单概率分布进行描述的噪声类型,而后者则包含无法使用简单概率分布建模的复杂偏色噪声。此外,我们设计了一个噪声解耦网络,由 SimpleDist 噪声消除网络 (SNRNet) 和 ComplexDist 噪声消除网络 (CNRNet) 组成,以顺序消除每个分量。此外,根据我们噪声模型中偏色噪声的不均匀性,我们在 CNRNet 中引入了可学习的位置嵌入来指示位置信息。为了验证我们的物理噪声模型和噪声解耦网络的有效性,我们采集了一个包含成对的长曝光清晰图像和短曝光含噪图像的真实 MSFA 去噪数据集。实验证明,使用我们噪声模型生成的合成数据训练的网络,其性能与使用成对真实数据训练的网络相当,且我们的噪声解耦网络优于其他最先进的去噪方法。
作者:Hansen Feng, Lizhi Wang, Yiqi Huang, Yuzhi Wang, Lin Zhu, Hua Huang
近年来,训练低光照 Raw 图去噪主流的做法已转向采用合成数据。噪声建模专注于刻画真实感光组件的噪声分布,深刻地影响着合成数据的有效性与实用性。目前,基于物理的噪声建模难以刻画完整的真实噪声分布,而基于学习的噪声建模则不切实际地依赖成对的真实数据。本文提出了一种全新的策略:从暗帧(dark frames)而非成对真实数据中学习噪声模型,以打破对数据的依赖。基于这一策略,我们引入了一种高效的物理感知噪声神经网络代理 (PNNP),用以逼近真实感光组件的噪声模型。具体而言,我们将物理先验整合进神经网络代理中,并引入了三项高效技术:物理引导的噪声解耦 (PND)、物理感知代理模型 (PPM) 以及可微分布损失 (DDL)。PND 将暗帧解耦为不同的组成部分,并灵活处理不同层级的噪声,从而降低了噪声建模的复杂度。PPM 结合物理先验来约束合成噪声,提升了噪声建模的准确性。DDL 为噪声分布提供了明确且可靠的监督,提升了噪声建模的精细度。PNNP 在刻画真实噪声分布方面展现出强大的潜力。在公开数据集上的广泛实验表明,该方法在实际低光照 Raw 图去噪中具有优异的性能。源码将公开于 https://fenghansen.github.io/publication/PNNP。