斩获 CVPR NTIRE 冠亚军,小红书如何提升短视频与直播体验质量?
RAIM 竞赛吸引 200+ 支队伍注册参赛,其中任务一共有 400+ 次提交。任务一的量化指标是多个计算指标分数的加权融合,其计算公式如下:
图 1.3 任务二部分结果展示 [2],从左到右:输入图、MiAlgo 队结果、Xhs-IAG 队结果、SoElegant 队结果、IIP_IR 对结果
表2.1 参赛队伍和排名
因此,为了提升终端用户的看播质量和体验,需要分析和追踪整个视频链路的质量问题,以整个链路的全局视角去审视和归因问题根源,从而提出最优解决方案。在评价方法上,除了离线测试,如何评价图像算法在亿级消费终端的实际效果是一个关键问题。
如何评价图像算法在大规模数据上的泛化性并自动化监测线上画质问题?我们自研了一个无参考视频质量评价指标 RedVQA[7],目前已经应用于点直播大盘监控、画质优化与推荐优化。
如何评价图像算法在消费终端的实际体验和影响?我们采用 AB 实验的方式,观测实验组 QoE(Quality of Experience)和 QoS(Quality of Service)指标是否优化或者劣化。核心 QoE 指标包括人均播放时长、播放次数等,核心 QoS 指标包括卡顿率、秒开率等。
如何评价图像算法部署带来的开销或成本?部署涉及的成本项包括带宽成本、计算成本和存储成本。一般来说,用户消费达到一定规模后,带宽成本远大于计算成本和存储成本。视频传输码率越大,带宽成本越大。
从学术到生产,从小规模测试集到大规模真实用户数据,不仅需要关注算法效果上限和整体表现,还需要关注算法下限和 badcase,前者能够带来大盘收益,后者避免用户投诉。提升算法在真实场景的泛化能力仍然是非常重要的课题,构建丰富场景和真实退化的数据集是关键之一。 效果之外,算法引入的带宽和计算成本是最大的约束项,前者关注对编码效率的影响,后者关注计算复杂度。综合来看,一个计算轻量、效果好、对编码效率友好的算法是我们所希望的。 综合泛化能力、成本约束以及基于 QoE/QoS 指标的真实体验考量,落地方案通常是前沿底层视觉算法和传统图像处理算法的结合体。在强计算资源约束下,一个精心设计有理论指导的传统图像处理算法通常可以实现更好的泛化能力和计算效率。
3.1 直播推流降噪
视频降噪应该集成在 camera 后还是美颜后?一种观点认为应该集成到美颜后,以缓解美颜显著放大噪声的问题。我们选择集成在 camera 后,主要考虑是: a). 视频降噪的目标是改善视频源画质,为后续所有处理提供一个更好的基础画质,因此应该作为基础画质提升模块去迭代,与美颜解耦;
鉴于开播端(如手机)计算资源有限,且美颜等效果处理通常占据不小的计算资源,为了保障开播流畅度并提升算法机型覆盖率,视频降噪和噪声估计算法需要保持在较低的算法复杂度和计算性能。我们当前基于传统算法设计这两个模块,视频降噪是一个基于光流估计的多帧时空自适应滤波算法,噪声估计是一个基于小波变换和特征值分解的混合框架多帧算法。 受限于算法复杂度,端侧噪声估计无法同时兼顾精确率和召回率,较低的精确率将频繁的开启降噪,占据计算资源、影响开播体验,而较低的召回率使得推流视频存在一定比例的噪声问题。云端质量评估算法被用于监控推流视频画质问题。具体来说,我们设计了云端噪声估计和图片质量评估算法分别对推流视频噪声问题和端侧节点质量异常问题进行监控,异常结果反馈推流端进行策略和模块参数调整。
编码考虑的是用最少的码率最大程度的代表原视频,编码后视频质量的上限是原视频。UGC 视频的特点是内容多样且画质差异大,如果能用画质修复及增强算法提升原视频的质量,那么转码视频质量也能进一步提升。例如一个带噪视频经过去噪算法后再编码,相同码率下主观画质得到显著提升。 当前主流的编码框架还比较传统,主要基于图像统计特性以及像素级预测变换,其固定的编码参数以及码控算法对不同场景和内容的视频来说显然不是最优的,因此通过对视频场景分类以及增加内容和语义理解,可以使得编码效果和效率得到进一步提升。 从主观感受来讲,对于感兴趣区域做画质增强和提升编码质量可以更有效的提升实际观看体验,而对于非感兴趣区域降低画质处理和编码质量,不太影响观看体验但有助于节省码率。
在智能转码设计中,我们要求画质有提升且码率有降低。在 R265 自研编码器基础上,我们利用人眼视觉感知的质量评估、画质增强以及码率质量预测模型构建智能转码 1.0 方案,如图 3.2 所示。
自适应锐化:传统锐化在增强画面主观清晰度的同时,无差别放大画面全部区域甚至噪声,使得编码效率下降、码率急剧上升。此外,传统锐化容易出现黑白边、边缘锯齿等伪像,副作用较大。自适应锐化 1.0 采用自适应滤波、自适应增益以及过锐抑制等技术,解决上述传统锐化问题。自适应锐化 2.0 进一步改善复杂细小纹理清晰度不佳的问题。
去压缩损失/去模糊:自适应锐化可以较好的提升整体清晰度,然而由于不具备学习能力,在面向轻微模糊的 UGC 视频时,画质提升幅度有限。此外,UGC 视频通常包含压缩损失或者画面毛刺,是编码效率降低的来源之一。当去除这些压缩损失和画面毛刺后,不但画面清晰度得到进一步提升,编码码率也会进一步降低,从而实现画质和成本双收益。基于深度学习的去模糊/去压缩损失算法实现了上述目标。
码率质量预测模型:当使用传统固定 crf 参数对线上视频进行压缩时,转码视频编码质量损失具有较大差异,用户看播视频质量无法得到保障。此外,基于质量成本 tradeoff,同一个视频通常需要构建多个不同质量和码率的档位,要求我们能够精确的根据质量或码率预设目标进行转码,码率质量预测模型用于实现上述目标。当前我们基于 vmaf 指标预测编码质量,后续我们将以 RedVQA 指标预测视频整体质量。
当设计超分算法时,首先要保证的是开启超分后的 QoS 关键技术指标不会显著劣化;而为了达到较高的覆盖率,算法性能需要满足在中低端机上流畅运行;此外,算法部署引入的功耗和发热也可能会影响用户体验和在线时长。这些目标或约束要求我们在有限的算法复杂度下尽可能的提升超分算法效果。在极轻量算法设计中,有图像理论指导的 low level 图像算法相比深度学习更高效,我们选择基于 patch 模式分类和自适应滤波的 two-stage 机器学习算法。
我们在云端为端侧超分定制了一个超分档位,其利用云端智能转码画质处理能力优化超分档位画质,通过提升输入视频质量补偿端侧超分最终呈现质量;同时利用云端智能转码的码率质量预测模型控制超分档位下发码率和编码质量,从而精准平衡体验质量和带宽成本。此外,采用多种策略来精细化控制超分档位消费体验。首先,通过带宽高峰期预测控制超分档位下发的时间段,只在带宽成本敏感时段进行下发;其次,通过质量&码率收益评估动态精细地量化出同源视频不同档位的码率和质量,为精细化档位选择和质量成本 tradeoff 决策提供支撑。
高级图像增强算法工程师
岗位职责:
1. 负责改善短视频、直播、RTC 等场景的视频画质体验并节省带宽,参与构建业界顶尖的音视频系统;
2. 负责视频图像前、后处理增强算法的研究与落地,包括但不限于超分、降噪、色彩增强、去抖动、去模糊、插帧、暗光增强、人像修复等;
3. 负责视频画质分析和质量评估算法的研究和落地,包括但不限于噪声估计、色彩/曝光/对比度/清晰度评价、美学/构图评价等;
4. 负责视频场景分类和分析,用于改善视频编码效率和传输效率,包括但不限于ROI 检测、场景分类、复杂度分析、带宽预测等。
工作职责:
1. 电子、计算机、通信或数学等相关专业,硕士及以上,五年以上工作经验;
2. 在图像、视频传统算法,深度学习、机器学习等人工智能领域有丰富经验, 具备扎实的图像处理算法基础, 有良好的数学功底;
3. 在图像超分辨、图像修复、图像去噪、无参考质量评价等领域有丰富的经验,擅长跟踪最前沿的学术界和工业界的人工智能技术;
4. 对视频降噪、视频超分等有深刻理解和落地经验者优先;有利用图像算法和深度学习改善视频编码效率的落地经验者优先;
5. 良好的编程基础,熟练掌握python/C/C++等编程开发技术和常用的数据结构、算法, 熟练使用业界常用的算法训练工具(tensorflow\caffe\pytorch之一);
6. 有大规模商用产品转化经验者优先;有算法优化、底层异构编程(arm/gpu/dsp)经验者优先;
7. 具备良好的沟通能力和合作精神,较强的进取心和英语能力。
欢迎感兴趣的同学发送简历至 [email protected],并抄送至 [email protected]。
上下滑动查看
[1]. CVPR NTIRE 2024 Challenges, https://clai.net/ntire/2024/.
[2]. NTIRE 2024 Restore Any Image Model (RAIM) in the Wild Challenge, CVPR 2024 Workshop, https://arxiv.org/abs/2405.09923.
[3]. NTIRE 2024 Challenge on Short-form UGC Video Quality Assessment: Methods and Results, CVPR 2024 Workshop, https://arxiv.org/abs/2404.11313.
[4]. CVPR 2024 NTIRE真实场景图像复原RAIM挑战赛正式启动,OPPO TECH,https://mp.weixin.qq.com/s/_xdBDJXD33oErmBBQwrXCQ.
[5]. CVPR 2024 Workshop | 首届短视频质量评价学术竞赛已启动+大型数据集KVQ,快手音视频技术部,https://mp.weixin.qq.com/s/MEjCWPdFtPI3G2AcItHZ-g.
[6]. Enhancing Blind Video Quality Assessment with Rich Quality-aware Features, CVPR 2024 Workshop, https://arxiv.org/abs/2405.08745.
[7]. 无参考视频质量评估算法研发及落地实践,第五届A2M互联网架构与AI技术峰会,https://www.bilibili.com/video/BV1Mx4y197RE/?vd_source=1b028037dcca7a6f6e3a858fe327cb8f.
[8]. 基于人眼感知质量的端云结合画质及带宽优化实践,LiveVideoStackCon音视频技术大会2023上海站,https://mp.weixin.qq.com/s/3yoQSHxayinGdwmzsjEN6A.
往期精彩内容指路
添加小助手,了解更多内容
微信号 / REDtech01