从“端云结合超分框架”到“科学解读 AB 实验数据”,小红书即将亮相音视频技术大会
随着新技术、新场景、新需求的不断涌现,如何为用户提供沉浸式的音视频体验,同时实现成本的有效降低,是当前音视频行业共同面临的挑战。在解决这些挑战的过程中,数据指标的构建、解读和优化也变得至关重要,以衡量音视频系统质量。
7 月 28 至 29 日,音视频技术大会「LiveVideoStackCon 2023」将在上海举行,此次大会以「沉浸 · 新视界」为主题,备受行业人士期待。小红书音视频架构负责人 陈靖 、直播业务客户端负责人 周博立 、音视频架构视频图像处理算法负责人 剑寒 、实验平台负责人 冰雁 将应邀作为专题出品人、专题评审人、技术讲师出席。
在大会期间, 剑寒 将带来 《基于人眼感知质量的端云结合画质及带宽优化实践》 的分享:
小红书音视频架构算法团队推出一项创新技术—一基于人眼感知质量的端云结合超分框架,有效解决了端侧计算资源和性能约束限制高级超分算法落地的问题。该框架利用云端视频处理,实现了端侧超分效果的可量化、高覆盖集成和带宽高节省特性,并采用基于人工智能的无参考视频质量评估指标,实现与人眼视觉一致的质量评价。这一解决方案为大规模量化用户体验质量提供了关键支撑,是提高用户体验质量和降低视频带宽成本的重要突破。
同时, 冰雁 将分享 《成也显著、败也显著 - 如何科学地解读AB实验数据》 :
AB 实验是构建 data-driven 文化和快速迭代的关键组件。尽管 AB 实验框架本身并不复杂,但实验数据的解读和决策常常令人困惑,例如关心的指标不涨,而其他指标却波动。全程将介绍 AB 实验框架的基本原理和统计学假设检验基础,以及如何使用这个不完美的工具得出有价值的业务结论。我们还将使用小红书迭代客户端超分能力的实验例子,具体说明为什么需要显著性来辅助实验指标解读,为什么纯粹依赖显著性不能客观地解读实验数据,以及如何科学地做实验决策。
小红书技术团队期待与业界技术专家保持交流,共同探讨新技术对多媒体音视频带来机遇与挑战。在大会开始前, 剑寒 率先解读议题,在与 LiveVideoStack(以下简称“ LVS ”) 的对话中,探讨如何跨方向技术融合,全局优化打造更智能的音视频系统,让我们一睹为快!
精彩内容 抢先看
LVS
可以概括介绍下你将在 LiveVideoStackCon 2023 上海站分享的题目吗?
剑寒: 我分享的题目是《基于人眼感知质量的端云结合画质及带宽优化实践》,也是”降本增效”背景下小红书的一个重点项目。如果简单看是一个端侧超分的算法落地,学术界和工业界基于这个技术点其实已经进行了很长的探索,但面向不同的业务场景和集成系统,端侧超分技术在业务目标和技术方向上会有很明显的区别。
比如面向一款新的硬件设备,只需要基于它的硬件加速器定制化地设计和优化算法即可。而视频业务及 APP 面向的终端用户设备多样复杂,技术优化的用户体验通常难以全面评估,落地覆盖率直接影响收益大小。
在这个场景下,端侧超分技术的演进方向不再是独立算法模块的设计和优化,而是结合从云端消费档位生产、人眼感知的质量评估到播控及端侧超分的整条视频处理链路的端到端优化,这会极大的释放端侧超分的潜力,一定程度上解决前面提到的技术挑战。本次分享是我们在这个主题下的一些系统总结和实践,当然这也是一个长期建设方向,当前我们已经拿到了一些收益,相信在这个框架下,未来通过技术迭代还会有很大的空间。
LVS
你怎么看待算力、成本和用户体验的这三角关系?
剑寒: 从静态的角度来讲,不做任何技术的优化,可以考虑用更大的算力、更高的成本去实现用户体验的提升,比如大的算力可以支撑更高复杂度且更好效果的算法落地,也提升了算法处理的时效性;为了提升用户体验,我们可以提升视频消费码率,而带来带宽成本的增加。或者反过来,通过牺牲一些用户体验节省算力和成本。音视频领域有很多这种 trade-off,也有很多特例,比如提升视频消费码率和分辨率一般情况会提升用户体验,但是在网络不好时可能会导致视频卡顿,用户体验反而下降。因此我更喜欢分析每个因素有什么优劣势,看每个变量在当前系统状态下会产生什么影响,针对具体业务目标 case by case 分析和决策。
而从动态的角度讲,由于技术是不停迭代的,可以通过技术优化同时提升用户体验并降低成本。比如现在每一代的编码标准,可以做到相同的质量下节省30%-50% 的码率,这意味着用户体验基本不变,但是带宽成本就节省了很多。上面提到的端侧超分技术,也有类似的收益。除了技术优化,还有很多策略发挥作用。比如现在 CDN 的带宽成本是根据高峰期收费的,这里的策略是,在非高峰期的时候我可以增加码率来提升用户体验,但并不增加带宽成本。当然这里也涉及一个准确预测高峰期时段的问题。
所以说音视频这个领域,它其实是一个系统,并不是一个单一的点,我们可以从算法上以及系统的策略上同时实现看似矛盾的业务目标。
LVS
面对用户追求更高清更极致的视频体验趋势,视频编解码的技术显得至关重要,针对这个以及其它技术方向,你们团队有什么目标吗?
剑寒: 视频编解码技术迭代非常重要,目前我们已经落地了 H.265 这一代标准,而且达到了很高的覆盖率,在研的包括 AV1 标准,已经开始了一些实验验证。未来 H.266 也可能会跟进。
除此之外,在 AI 时代,构建更智能的音视频处理是我们的一个目标,这里包括各种画质增强及修复技术、质量和内容分析技术、以及智能编码技术。在技术方向上,首先会结合业务优先级把单点技术能力做好,比如使用云端超分技术提升 1080P 视频占比,面向通用场景的纹理及清晰度视频增强。此外,我们会迭代一些具有长期价值和收益的技术框架,比如云端”窄带高清”、端云结合超分、人眼感知的质量评估等。
现在音视频处理的智能化程度其实还有很大空间,个人理解挑战主要有两个方面:
1. 音视频处理不是单一技术,从当前技术发展来看,很难用一个大模型来实现,一个更智能的视频处理系统应该是包含 high level 语义理解、low level 图像处理、编解码技术的某种融合体,而当前算法方向的典型人才画像是聚焦在某一个技术点上。我相信未来复合型人才和具有系统理解的算法人有机会做出突破。
2. 智能化意味着大数据驱动,ChatGPT 的训练数据可以来自高质量的问答,通过自监督训练进行大规模学习,构建高质并准确的数据集在音视频领域会更加困难,Groudtruth 以及退化模型是否准确通常是音视频算法面临的第一个关键问题。
目前业界的探索更多的集中在单点能力的智能化,比如利用图像生成技术的画质增强算法、利用AI提升编解码子模块效率等,这些都是我们可以跟进的技术点,但我们也希望在跨方向技术融合以及全局优化能力上做更多的探索和实践,为此来找到提升音视频系统智能化的有效途径。
LVS
每个人都有自己认为的主观好与坏,所以,该如何验证画质优化算法对主观质量提升是否有效?
剑寒: 这个问题其实也是前一个问题回答中所说的“构建高质并准确的数据集在音视频领域会更加困难”的一个佐证,每个人对于画质好坏的判断都是不一样的。不过,是有国际标准来指导的,简单说就是,在一个可控环境条件下,通过专家评测和众测来判断画质是否有提升,其中众测是对于同一个视频收集多人的评价结果,通过统计的方法来消除个体上的差异,虽然不一定符合某个人的判断标准,但是代表了大多数人的意见。
当然,主观专家评测和众测由于时间和操作成本只能在小数据量上验证,真正上线还需要经过大盘的检验,这里一般会使用 AB 实验的方式,通过对比一些关键业务和技术指标来佐证大盘上的表现。需要注意的是,AB 实验的影响因素很多,不完全是画质上的,需要结合方案具体分析实验数据。
LVS
作为一个非常大的 UGC 内容社区,小红书图像或视频的来源可以说非常宽泛,所以有时真实拍摄环境不受控,导致内容质量不能保证。这种质量评价问题,你是怎么处理的?
剑寒: 我们今年落地了一个基于 AI 的无参考视频质量评估算法来解决这个问题,它基于人眼感知质量对任意视频做绝对质量评判,像你说的,UGC 视频的多样性对于数据驱动的 AI 算法来说是一个挑战。此外,当视频经过整个视频链路的处理后质量变化也极大,带来了更大的复杂性,比如特效编辑、多档位视频增强和转码等。因此,数据集是要精心设计的,既要包含线上的主要质量问题,同时需要主动构造一些难以直接从线上采集到的 case,核心点是,如何用尽量少的数据样本代表大盘,这里有一些技术上的辅助手段,比如数据采样方法。
算法设计上,重点是如何有效提取质量特征,这里需要对质量问题的产生过程有充分的认知,比如视频链路中编辑和转码会如何影响质量,我总结几个关键点分享给大家:
1. 全局构图和局部纹理信息都很重要,质量相关特征体现在局部纹理上,而劣化程度在于全局感知;
2. 捕捉大范围时空信息及依赖关系,人眼对质量的感知涉及到整体语义理解、关注区域、创作意图理解等,很多视频处理操作会在较大的时空范围内影响质量,比如码率分配、ROI 编码等。
3. 质量评估数据集的量级和完备程度远低于分类识别等 CV 任务,我们需要某种显式地辅助质量特征提取的手段,一种方法是通过添加有序的质量样本或者利用质量评估的代理任务,进行数据增强及质量特征自监督学习。
音视频技术的全面发展和工业化,都将推动产业不断向前发展。与此同时,小红书技术团队会继续不断学习和探索,积极参与行业交流,共同探讨音视频技术的发展方向,期待音视频产业的发展前景更加广阔。
岗位职责: 1. 负责改善短视频、直播、RTC 等场景的视频画质体验并节省带宽,参与构建业界顶尖的音视频系统; 2. 负责视频图像前、后处理增强算法的研究与落地,包括但不限于超分、降噪、色彩增强、去抖动、去模糊、插帧、暗光增强、人像修复等; 3. 负责视频画质分析和质量评估算法的研究和落地,包括但不限于噪声估计、色彩/曝光/对比度/清晰度评价、美学/构图评价等; 4. 负责视频场景分类和分析,用于改善视频编码效率和传输效率,包括但不限于 ROI 检测、场景分类、复杂度分析、带宽预测等。
任职资格: 1. 电子、计算机、通信或数学等相关专业,硕士及以上,三年以上工作经验; 2. 在图像、视频传统算法,深度学习、机器学习等人工智能领域有丰富经验, 具备扎实的图像处理算法基础, 有良好的数学功底; 3. 在图像超分辨、图像修复、图像去噪、无参考质量评价等领域有丰富的经验,擅长跟踪最前沿的学术界和工业界的人工智能技术; 4. 对视频降噪、视频超分等有深刻理解和落地经验者优先;有利用图像算法和深度学习改善视频编码效率的落地经验者优先; 5. 良好的编程基础,熟练掌握 python/C/C++ 等编程开发技术和常用的数据结构、算法, 熟练使用业界常用的算法训练工具( tensorflow \ caffe \ pytorch 之一); 6. 有大规模商用产品转化经验者优先;有算法优化、底层异构编程( arm / gpu / dsp )经验者优先; 7. 具备良好的沟通能力和合作精神,较强的进取心和英语能力。
欢迎感兴趣的朋友发送简历至: [email protected]; 并抄送至: [email protected]
小红书2024届REDstar技术提前批招聘火热进行中,快喊上学弟学妹看过来!【附专属内推码】 CVPR2023|小红书提出 OvarNet 模型:开集预测的新SOTA,“万物识别”有了新玩法 让算力不再成为瓶颈,小红书机器学习异构硬件推理优化之道
添加小助手,了解更多内容 微信号 / REDtech01