13 组 · 39 个视频 · 按帧序号对齐 · 无 HR 真值评测
三路视频超分深度评测
结论先行:腾讯是当前更强的工程基线,结构保持、平均时序残差和码率效率占优;但 0/1/10 号样本出现近似静止帧,且更激进的纹理增强存在幻觉风险。PS-SR 的超高码率使现有成品不适合直接归因到模型。
公网播放版本说明
本页指标由原始输出计算。为满足浏览器播放与 Cloudflare 单文件限制,PS-SR 视频仅在公网播放副本中重新编码;Original 与 Tencent 仅重新封装并清除元数据。网页播放文件的码率不能用于替代报告中的原始码率。
这份报告能证明什么,不能证明什么
- 能证明:视频规格、帧数、PTS、编码体积;以及输出回缩后与输入结构的一致程度。
- 能量化但不能等同质量:锐度、边缘密度、高频能量、时序残差。更高锐度可能是恢复,也可能是振铃、噪声或幻觉。
- 不能证明:真实 1080p 细节恢复正确性,因为 original 只有 720×1280,不是 ground truth。
- 不能比较:推理耗时。输入目录没有运行日志;本次分析自身耗时 89.5 秒,不是模型耗时。
总览证据
核心判断
- 结构保持:腾讯平均 SSIM-Y 0.9407,PS-SR 0.8762;腾讯赢 12/13。
- 锐度与风险:腾讯/PS-SR 相对 Lanczos 基线的 Laplacian 中位倍率为 4.34× / 2.84×。5 号和 11 号显示,两路都可能制造不可靠微结构。
- 时序:平均高频残差腾讯 0.834、PS-SR 1.129,但腾讯的局部近似冻结必须单独修。
- 颜色:ΔE00 均值 PS-SR 3.12、腾讯 3.30,胜场 7:6,没有稳定赢家。
- 编码:平均码率 PS-SR 85.6 Mbps、腾讯 5.7 Mbps。下一轮必须统一编码。
配对统计
13 个样本做双侧 Wilcoxon,6 项探索指标做 Holm 校正。显著项:源结构一致性 SSIM-Y Holm p=0.0029;显示尺度 Laplacian Holm p=0.0322;时序细节残差 Holm p=0.0171。它们证明代理指标分布不同,不证明生成细节真实。
逐样本指标
| ID | 内容 | SSIM-Y PS / 腾讯 | ΔE00 PS / 腾讯 | 时序残差 PS / 腾讯 | Mbps PS / 腾讯 | 异常 | 观察重点 |
|---|---|---|---|---|---|---|---|
| 0 | 极暗场景 / 金属细线 | 0.7364 0.9561 | 1.57 1.27 | 0.476 0.280 | 71.7 2.6 | 腾讯近似静止帧对 1 | 看钥匙轮廓、暗部噪声和反光边缘;暗部提亮不等于真实细节。 |
| 1 | 暗场门洞 / 多人物 | 0.8477 0.9617 | 2.02 1.53 | 0.407 0.246 | 71.2 1.7 | 腾讯近似静止帧对 6 | 低运动区对压缩和重复帧敏感;腾讯出现 6 对近似静止相邻帧。 |
| 2 | 暗肤色人像近景 | 0.8067 0.9719 | 2.18 1.64 | 0.478 0.379 | 74.0 1.6 | — | 重点看眼睫、发丝和肤色,不应把毛孔增强直接视为恢复。 |
| 3 | 明亮人像 / 皮肤与文字 | 0.8966 0.9705 | 2.78 1.96 | 1.594 0.943 | 85.3 7.8 | — | 人脸可感知收益明显,但皮肤纹理也最容易被过度重构。 |
| 4 | 高密度幻想建筑 | 0.8298 0.9367 | 3.74 2.73 | 4.190 2.527 | 127.3 16.2 | — | 细线、树叶和小人物极多,是锐化收益与伪纹理风险同时最大的样本。 |
| 5 | 金属钥匙微距 | 0.8652 0.8727 | 3.17 2.62 | 1.325 1.317 | 104.1 12.0 | — | 腾讯生成强烈划痕状微纹理,PS-SR 更平滑;无 HR 真值时无法证明哪种纹理真实。 |
| 6 | 手掌与金属物体 | 0.9318 0.9451 | 3.69 3.96 | 1.009 0.789 | 81.6 4.6 | — | 同时检查肤色、掌纹、金属边缘和景深区域。 |
| 7 | 逆光背影 / 点光源 | 0.9349 0.9391 | 3.44 4.68 | 1.153 1.273 | 85.3 5.4 | — | 检查灯光光晕、门框边缘和暗部时序;本例 PS-SR 的时序残差反而更低。 |
| 8 | 教堂纵深 / 重复线条 | 0.8993 0.9164 | 3.34 4.28 | 0.628 0.555 | 73.9 6.6 | — | 长直线和重复结构容易暴露振铃、纹理漂移与编码块。 |
| 9 | 人像与背景人群 | 0.9269 0.9243 | 3.68 4.82 | 0.495 0.394 | 69.3 2.8 | — | 本例是 PS-SR 唯一结构一致性略高的样本,也显示模型优劣依赖内容。 |
| 10 | 室内广角 / 人物群像 | 0.9266 0.9440 | 3.45 4.62 | 0.810 0.708 | 81.1 4.3 | 腾讯近似静止帧对 13 | 腾讯平均更接近源,但检测到 13 对近似静止相邻帧,是最重要的时序失败样本。 |
| 11 | 眼部极近景 | 0.8450 0.9311 | 3.88 4.87 | 1.598 1.041 | 116.3 6.0 | — | PS-SR 在下眼睑出现珠状/刻蚀感,腾讯更平滑;两者都需以原始高分辨率真值裁决。 |
| 12 | 双手、钥匙与散景 | 0.9439 0.9596 | 3.60 3.90 | 0.514 0.385 | 71.4 2.3 | — | 检查手指边缘、钥匙细线、背景虚化是否被错误锐化。 |
逐样本视频与细节
样本 0 · 极暗场景 / 金属细线
看钥匙轮廓、暗部噪声和反光边缘;暗部提亮不等于真实细节。
代表帧:60。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 1 · 暗场门洞 / 多人物
低运动区对压缩和重复帧敏感;腾讯出现 6 对近似静止相邻帧。
代表帧:60。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 2 · 暗肤色人像近景
重点看眼睫、发丝和肤色,不应把毛孔增强直接视为恢复。
代表帧:60。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 3 · 明亮人像 / 皮肤与文字
人脸可感知收益明显,但皮肤纹理也最容易被过度重构。
代表帧:108。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 4 · 高密度幻想建筑
细线、树叶和小人物极多,是锐化收益与伪纹理风险同时最大的样本。
代表帧:72。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 5 · 金属钥匙微距
腾讯生成强烈划痕状微纹理,PS-SR 更平滑;无 HR 真值时无法证明哪种纹理真实。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 6 · 手掌与金属物体
同时检查肤色、掌纹、金属边缘和景深区域。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 7 · 逆光背影 / 点光源
检查灯光光晕、门框边缘和暗部时序;本例 PS-SR 的时序残差反而更低。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 8 · 教堂纵深 / 重复线条
长直线和重复结构容易暴露振铃、纹理漂移与编码块。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 9 · 人像与背景人群
本例是 PS-SR 唯一结构一致性略高的样本,也显示模型优劣依赖内容。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 10 · 室内广角 / 人物群像
腾讯平均更接近源,但检测到 13 对近似静止相邻帧,是最重要的时序失败样本。
代表帧:120。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 11 · 眼部极近景
PS-SR 在下眼睑出现珠状/刻蚀感,腾讯更平滑;两者都需以原始高分辨率真值裁决。
代表帧:72。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
样本 12 · 双手、钥匙与散景
检查手指边缘、钥匙细线、背景虚化是否被错误锐化。
代表帧:48。视频按相同帧序号比较;浏览器显示的容器总时长可能略有不同,但有效帧 PTS 相同。
产品决策
- 腾讯可作为默认候选,但先修复/解释 0、1、10 号近似冻结帧。
- 统一编码器、CRF、GOP、色彩元数据后复跑,分离模型收益与编码收益。
- 新增原生 1080p 真值集,通过合成 720p 输入评估真实 fidelity。
- 按低光、人像、密集结构、金属表面设独立门槛,不做一个掩盖失败样本的总分。
- 推理端记录 decode / inference / encode / total / peak VRAM;使用同目录计时模板。
机器数据:metrics.json · metrics.csv · 计时模板 · Markdown 报告