将生成式真实图像超分辨率模型与人类视觉偏好相结合,由于感知与感知的权衡以及多样化且未知的退化,具有挑战性。以往的方法依赖于离线偏好优化和静态度量聚合,这些聚合通常不可解释,且在良好条件条件下容易发生伪多样性。我们提出OARS,这是一个基于COMPASS的流程感知在线对接框架,COMPASS是一种基于MLLM的奖励,通过结合对保真性保存和感知收益进行建模,从而评估LR与SR的过渡,并实现基于输入质量的权衡。为了训练 COMPASS,我们设计出涵盖合成和真实降解的 COMPASS-20K,并引入三阶段感知标注管道,可生成经过校准、精细化的训练标签。在 COMPASS 的指导下,OARS 通过浅层 LoRA 优化,通过在策略上进行探索,从冷启动流量匹配到全参考,最终实现无参考 RL 的渐进式在线对齐。广泛的实验和用户研究表明,在保持保真度的同时,能够持续改进感知效果,从而在Real-ISR基准测试中实现最先进的性能。