ICLR2027-摘要截止
NeurIPS2026-论文开奖
ICLR2027-正文提交
AAAI2027-反驳开始
AAAI2027-反驳结束
ICLR2027-反驳结束
ICLR2027-反驳开始
AAAI2027-论文开奖
00天 00: 00: 00
00/00
共2119条结果
重置
作者:Xiaoyang Liu, Bolin Qiu, Zheng Chen, Libo Zhu, Zihan Zhou, Kai Liu, Jiezhang Cao, Yulun Zhang
时间:2026
刊物:European Conference on Computer Vision (ECCV)
图像去摩尔纹仍是一项具有挑战性的任务,这主要归因于摩尔纹图案所导致的纹理破坏与颜色失真之间复杂的相互作用。现有方法,尤其是依赖直接图像到图像复原的方法,往往无法有效解耦这些交织在一起的伪影。尽管基于频域感知的方法提供了一个有前景的方向,但其潜力受到了离散变换(例如 Haar 小波或基于分块的 DCT)的制约,这些变换可能存在空间不连续性和通道冗余,并在其固定的逆变换过程中进一步引发误差累积。在本文中,我们提出了 Freqformer,一个专为图像去摩尔纹设计的 Transformer 框架,通过针对性的频率分离来实现复原。我们的方法执行了一种有效的频率分解,将摩尔纹图案分解为高频的空间局部化纹理和低频的尺度鲁棒性颜色失真,随后利用针对它们各自特性定制的双分支架构和非对称训练方案进行处理。我们进一步提出了一个可学习的频率合成变换(FCT)模块以自适应融合特定频率的输出,从而实现连贯且高保真的重建。为了更好地聚合空间依赖性和通道间的互补信息,我们引入了空间感知通道注意力(SA-CA)模块,在不引入高昂计算开销的前提下对摩尔纹敏感区域进行精细化调整。在多个去摩尔纹基准上的大量实验表明,Freqformer 以紧凑的模型尺寸实现了最先进的性能。代码将在指定链接公开提供。
作者:Pengchao Wei, Xiaojie Guo
织物摩尔纹是由精细纺织图案与相机传感器网格之间相互作用引起的采样混叠伪影,产生的结构化干扰会严重降低图像质量。与源于严格周期性显示点阵的屏幕摩尔纹不同,织物摩尔纹因纺织编织物固有的宽带和半周期特性而在本质上更具挑战性。固有纹理与混叠成分之间严重的频谱重叠,使得织物去摩尔纹问题具有更强的不适定性(ill-posed)。因此,在屏幕摩尔纹数据集上训练的现有模型对于这些复杂的织物图案泛化能力较差。尽管具有重要的实际应用价值,织物图像去摩尔纹仍缺乏深入探索且缺少标准化基准。我们提出了首个全面的织物图像去摩尔纹基准。为了解决获取真实世界像素对齐图像对的困难,我们开发了一个基于物理机制的合成框架,并构建了一个包含 16,050 对具有可控混叠严重程度的多分辨率织物图像的大规模数据集。此外,我们定制了一个基线模型,该模型在所提出的基准数据集上取得了出色的性能并具备强大的泛化能力。我们的基准为推进织物图像去摩尔纹领域的研究提供了一个标准化平台。
作者:Dongheng Lin, Jianbo Jiao
在动画制作中,手绘动画的油漆桶着色是一项劳动密集型工序,需要依据参考设定图为线稿中的每个闭合区域分配颜色。近期的自动化油漆桶着色流程通过区域对应关系来复现这一工作流,但当区域缺乏恰当上下文而表现为模糊碎片时,这种对应关系容易变得脆弱失效。在本文中,我们提出了调色板上下文辅助(PeCA),一种全新的免训练、即插即用型动画视频着色框架,旨在测试期通过对时空上下文进行推理来弥补这一缺陷。在现有基准测试及新引入的长视频测试用例上的大量实验表明,该方法取得了持续的性能提升。
作者:Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li
线稿着色是专业内容创作中的关键阶段,然而在多样化的用户约束条件下实现精确且灵活的效果仍是一项重大挑战。为此,我们提出了 OmniColor,一个支持任意控制信号组合的多模态线稿着色统一框架。具体而言,我们系统地将引导信号划分为两类:空间对齐条件与语义参考条件。对于空间对齐输入,我们采用双路径编码策略并结合密集特征对齐损失,以确保严格的边界保持和精确的颜色复原;对于语义参考输入,我们利用集成时间冗余消除机制的纯视觉语言模型(VLM-only)编码方案,以过滤重复信息并提高推理效率。为解决潜在的输入冲突,我们引入了自适应空间-语义门控模块,动态平衡多模态约束。实验结果表明,OmniColor 实现了卓越的可控性、视觉质量和时间稳定性,为线稿着色提供了一种鲁棒且实用的解决方案。源代码和数据集将在指定链接开源。
作者:Swarnim Maheshwari, Syed Imam Ali, Vineeth N. Balasubramanian
大多数图像着色系统都在 Lab 空间下运行,通过在保留源自输入的亮度通道(L)的同时预测色度(ab)。尽管该固定亮度设计在标准基准测试中表现有效,但它限制了亮度的变化;且当灰度生成机制偏离自然图像亮度时(例如在历史正色摄影中),该设计便不再可靠。我们提出了一种亮度无关的着色框架,利用基础图像编辑模型将着色问题构建为全 RGB 图像编辑任务。为了连接现代全色(panchromatic)与历史正色(orthochromatic)成像条件,我们引入了一种混合灰度目标函数,使模型在标准亮度灰度和红光不敏感的灰度生成机制下同时进行训练。在 COCO、ImageNet 以及多实例基准上的实验表明,我们的方法在标准灰度输入上具备极具竞争力的表现,且在正色输入下鲁棒性大幅提升;定性对比和人工主观评估均表明其可见的颜色伪影更少。
作者:Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu
在雨天通过玻璃表面或挡风玻璃拍摄图像时,雨滴和反射常常同时出现,显著降低了拍摄图像的可见度。这一实际问题缺乏关注,亟需解决。此前的去雨滴、去反射和一体化模型未能解决复合材料的劣化问题。为此,我们首先正式定义雨滴和反射的统一去除(UR首次构建了一个实测数据集,即RainDrop and ReFlection(RDRF),该数据集提供了具有大量、高质量、多样化图像对的新基准。然后,我们提出了一种新的基于扩散的框架(即DiffUR)并设计了多个目标以应对这一具有挑战性的任务。通过利用强大的生成先验,DiffUR成功消除了这两种类型的降解。大量实验表明,我们的方法在基准测试和具有挑战性的野外图像上都达到了最先进的性能。RDRF数据集及代码将在接受后公开。
作者:Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu
单张图像反光去除(SIRR)在真实场景中极具挑战性,因为反光强度在空间上分布不均,且反光图案与透射层结构紧密纠缠。本文提出了一种基于先验调制的扩散模型框架(FUMO),该框架引入显式先验以实现空间自适应条件控制和结构保真的图像复原。两种先验直接从混合图像中提取:一种是用于估计空间反光严重程度的强度先验;另一种是通过多尺度残差聚合捕获细节敏感响应的高频先验。我们提出了一种由粗到细的训练范式。在第一阶段,结合这些线索以门控条件残差注入,使条件控制聚焦于同时属于反光主导且结构敏感的区域;在第二阶段,细粒度精炼网络在图像空间中校正局部未对齐现象并锐化精细纹理。在标准基准数据集和极具挑战性的真实野外图像上的实验表明,该方法取得了极具竞争力的定量结果,并持续提升了感知质量。代码已在指定链接开源发布。
作者:Mahmoud Afifi, Ran Zhang, Michael S. Brown
数码相机将场景光线数字化为线性 Raw 表征,随后图像信号处理器(ISP)将其转换为适合显示的输出图像。尽管 Raw 数据完整保留了传感器信息——这对于后期编辑和视觉任务极具价值——但诸如数字负片(DNG)等格式需要庞大的存储空间,导致其在受限场景下难以实用。相比之下,JPEG 是一种获得广泛支持的格式,具有极高的压缩效率与良好的兼容性,但并不适用于存储 Raw 数据。本文提出了 RawJPEG Adapter,一个轻量级、可学习且可逆的预处理流水线,使 Raw 图像能够适配标准的 JPEG 压缩。我们的方法应用了空间变换以及可选的频域变换,并将紧凑的参数存储在 JPEG 的注释字段(comment field)中,从而实现了对 Raw 数据的精确重建。在多个数据集上的实验表明,该方法相比直接使用 JPEG 存储取得了更高的保真度,支持拓展至其他编解码器,并在压缩比与重建精度之间实现了极佳的权衡。
作者:Daowen Li, Ruixiao Dong, Kai Li, Ying Chen, Ding Ding, Li Li
感知视频压缩利用生成先验在低码率下重建逼真的纹理与运动。然而,现有的感知编解码器通常缺乏对可变码率和渐进式传输的原生支持,且其生成模块与熵编码之间呈弱耦合状态,限制了码率的进一步降低。受视觉自回归(VAR)模型中下一尺度预测(next-scale prediction)思想的启发,我们提出了 ProGVC,一个基于渐进式的生成视频压缩框架,在单一编解码器中统一了渐进式传输、高效熵编码以及细节合成。ProGVC 将视频编码为分层的多尺度残差 token 图,通过以由粗到细的渐进方式传输尺度的子集,实现了灵活的码率自适应。基于 Transformer 的多尺度自回归上下文模型负责估计 token 概率,该概率既用于对所传输 token 进行高效熵编码,又用于在解码端预测被截断的细尺度 token 以恢复感知细节。大量实验表明,作为一种全新的编码范式,ProGVC 在低码率下展现出极具前景的感知压缩性能,同时具备实用的可扩展性。