近日,通信工程学院智能信息系统殷海兵教授团队视频编码研究成果被2篇TRANS汇刊接收并在线发表。上述成果均以杭州电子科技大学为第一完成单位,系列成果的持续产出,反映了智能信息系统团队围绕视频编码、硬件设计等方向开展的系统研究积累,也为我院信息与通信工程学科建设提供了有益支撑。
成果1:
该论文第一作者为我院博士研究生曹子怡,殷海兵和王鸿奎为通讯作者,发表于IEEE Transactions on Circuits and Systems for Video Technology,题目为:SWFNet: A Spiking-Wavelet Fusion Network for Frame-Level Quality Enhancement of VVC-Compressed 360-Degree Video。
360度视频是虚拟现实、全景直播和沉浸式媒体的重要内容载体。为降低4K/8K全景视频的传输与存储开销,VVC/H.266通常需要进行较强压缩,容易引入块效应、振铃和细节丢失。与此同时,等距柱状投影(Equirectangular Projection, ERP)在高纬度区域存在拉伸和过采样,使失真呈现明显的空间非均匀性。现有卷积网络难以充分建模全局结构,Transformer方法在超高分辨率输入下又面临较高的计算和存储开销,因此,如何兼顾全景结构恢复、局部细节重建与计算效率,成为该领域亟待解决的问题。

为解决这些问题,该文提出脉冲-小波融合网络SWFNet,受灵长类视觉系统大细胞-小细胞双通路机制启发,构建由脉冲全局通路和小波局部通路组成的协同框架,分别捕获长距离结构依赖和恢复多尺度高频纹理。标准JVET 4K/8K全景视频序列上的实验表明,SWFNet以1.48M参数和10.30 GFLOPs取得37.18 dB平均PSNR和0.9512平均MS-SSIM,在恢复质量与计算效率之间实现了良好平衡。
成果2:
该论文第一作者为我院24级硕士研究生史玉申,指导教师为殷海兵教授,发表于IEEE Transactions on Broadcasting,题目为:Relevancy-Guided Adaptive Decoupling for Multi-Module Joint Optimization in Perceptual Video Coding。
感知视频编码能够在有限带宽下提升视频主观质量。在带宽受限条件下平衡视觉质量与编码效率,是视频编码领域的重要问题。然而,现有编码系统中的时间调制、空间调制、感知模式决策等多个模块存在复杂的非线性耦合关系,独立调参容易产生参数冲突和局部最优,静态参数也难以适应动态视频内容。

针对上述问题,该论文提出相关性引导的多模块联合优化自适应解耦框架。论文首先构建跨模块相关性指标,量化不同编码模块之间的相互影响;随后提出影响力递增优化策略和相关性引导块坐标下降算法,将复杂的联合搜索转化为确定性的逐步优化过程;同时设计在线自适应参数模型,根据视频实时的时空特征动态调整编码参数,使编码器能够适应不同场景的内容变化。
在 HEVC/x265平台和22个JCT-VC测试序列上的实验表明,所提出的离线优化策略平均提升1.31 BD-VMAF,在线模型相对 x265 Slow 预设进一步实现平均1.94 BD-VMAF提升,BD-PSNR和BD-SSIM基本保持不变,归一化编码复杂度仅为1.81倍。该研究有效缓解了感知视频编码中的模块耦合问题,在提升主观感知质量的同时保持客观编码性能,为带宽受限的视频广播和流媒体传输提供了具有实际应用价值的优化方案。
杭州电子科技大学“智能信息处理实验室”(HDU IIPLab)主任为颜成钢教授。实验室现有在职教师50余名,含5位国家级人才及多位省级人才。现有硕博生200余名,毕业生多就职于阿里巴巴、腾讯、字节跳动、海康威视、华为、网易等国内知名企业。实验室为学校交叉创新团队,拥有自由开放的学术氛围和国际前沿的研究方向。实验室采用与海内外知名高校、研究所(清华大学、北京大学、中国科学院、美国北卡罗来纳大学教堂山分校、澳大利亚悉尼科技大学等)联合培养制,长期致力于智能信息处理方面的研究,主要研究方向包括:机器学习、模式识别、计算机视觉、计算机图形学、医学影像处理、生物信息学等。
图文:黄晓峰
一审:黄晓峰
二审:邱一波
三审:孙闽红
