VLC与FFmpeg核心开发者解密:视频压缩如何运作,以及它为何如此复杂撰文:Techub News 整理
在Lex Fridman的播客中,两位开源多媒体领域的重量级人物——传奇播放器VLC的首席开发者Jean-Baptiste Kempf(JB)和FFmpeg项目的核心贡献者Kieran Kunhya——进行了一场深度技术对话。他们拆解了从点击播放到画面呈现的「黑盒」过程,解释了为何视频压缩能高达千倍,并分享了FFmpeg与VLC如何成为互联网视频基础设施的基石。对于任何希望理解数字媒体底层逻辑的人,这都是一次不可多得的知识盛宴。
从点击播放到画面呈现:不为人知的复杂旅程
当你用VLC打开一个视频文件或点击一个流媒体链接时,一个庞大而精密的技术机器便开始无声运转。JB概括了整个过程:首先,播放器需要从一个地址(如URL、本地文件路径或DVD)获取原始数据流。这是与操作系统交互的第一步,得到的是一个连续的字节流。
接下来是关键的一步:解复用。容器(如MP4、MKV)就像一个包裹,里面封装了视频、音频、字幕等多个轨道的数据流。解复用器(Demuxer)的任务就是拆开这个包裹,将混杂的数据流分离成独立的视频流、音频流等。Kieran指出,这仅仅是开始,后续每一步都蕴含着巨大的复杂性。
分离出压缩的视频数据后,播放器需要判断使用何种方式解码。一个常见的误解是GPU硬件解码能处理一切。JB透露,实际上高达45%的视频文件无法被GPU解码,必须回退到软件解码。播放器需要探测视频流的编码语法,识别其具体变种,并比对不同GPU厂商的支持能力,才能做出正确决策。
如果使用软件解码,核心的数学解码过程便开始了。首先是熵解码,即使用霍夫曼编码或算术编码等方法,将高度压缩的比特流进行第一步解压缩。然后进入帧内预测阶段,处理视频中的关键帧(I帧)。I帧是空间域上的完整图像,解码器需要预测每个图像块,但预测总与真实值有差异,这个差异被称为残差。残差信息通常存储在频率域中并经过量化,解码器需要做反量化、反变换,将其转换回空间域,再与预测值相加,最终重建出原始图像块。
这只是静态图像(I帧)的解码。视频压缩的魔力更多体现在时间压缩上。通过运动估计与补偿,编码器只需存储帧与帧之间的变化部分,而非每一帧的完整信息,从而实现了巨大的压缩比。解码器则根据这些运动向量和残差信息,从已解码的参考帧中预测出当前帧。
最后,解码出的原始图像(通常是YUV色彩空间)需要经过色彩空间转换、缩放等后处理,再通过显卡渲染到屏幕上。音频流也经历类似的解码过程,最终通过声卡输出。正如Kieran所感慨的:“我们刚才描述的每一句话,都是某些人毕生的工作。每一句话背后都有专著论述,都有成千上万的行业人员在研究。”
压缩的艺术:为人类感知而“降级”
视频与音频压缩的目标与传统的文件压缩(如ZIP)有本质区别。ZIP追求无损,输入输出数据必须完全一致。而多媒体压缩是有损的,其核心哲学是在人类感知允许的范围内,尽可能多地剔除“不重要的”信息。
JB用数字说明了这种压缩的极端程度:从普通音频到MP3,压缩比大约是10倍。而视频压缩,目标则是惊人的200倍乃至1000倍。为了实现这种级别的压缩,必须深入理解人类感官的工作原理。
“所有编解码器,无论是音频还是视频,本质上都是在模仿人类的耳朵和眼睛的工作方式。” JB解释道。例如,视频编码并不直接处理常见的RGB色彩空间,而是使用YUV。Y代表亮度(Luminance),UV代表色度(Chrominance)。这模仿了人眼视网膜中视杆细胞(对明暗敏感)和视锥细胞(对颜色敏感)的不同特性。基于此,编码器可以大幅降低色度分量的分辨率(例如使用4:2:0采样),在不引起明显视觉察觉的情况下,直接将数据量减半。
随后,编码器运用强大的数学工具进行变换。最经典的是将图像块从空间域转换到频率域的离散余弦变换。在频率域中,能量集中在少数低频系数上,高频系数(代表细节)则可以被更激进地量化甚至丢弃。这就是为什么在低码率或解码错误时,我们看到的不是模糊,而是出现明显的“方块”——因为解码丢失了每个图像块内的高频细节。
Kieran补充了编解码器发展的一个关键趋势:每一代新标准(如从H.264到H.265/HEVC,再到AV1)通常能在相同画质下带来约30%的码率节省。但这节省的代价是巨大的。“为了提升这30%的效率,所需的编码计算复杂度可能增加一个甚至两个数量级。” 这意味着更强大的CPU/GPU和更长的编码时间。
容器与编解码器:被行业混淆的“房子”与“家具”
一个普遍的技术混淆点在于容器格式和视频编解码器。JB和Kieran对此进行了澄清。
容器(如MP4、MKV、MOV、AVI)就像一栋房子,它是一个封装格式,内部可以容纳视频轨、音频轨、字幕轨等多种数据流。容器的另一个名称是“复用器”(Muxer),而解封装的过程就是“解复用”(Demux)。
编解码器(Codec,编码器/解码器合称)则像是房子里的家具,如H.264、AV1、AAC等,是实际对音视频数据进行压缩和解压缩的算法。
“人们经常把MP4和H.264搞混,这其实不能全怪用户。” Kieran说,这很大程度上是行业命名混乱造成的。H.264的官方标准名是MPEG-4 Part 10(高级视频编码,AVC)。而MPEG-4是一个庞大的标准家族,其中还包含MPEG-4 Part 2(一种较老的视频编码)、AAC音频编码等。MP4容器则是基于MPEG-4标准定义的另一种东西。因此,技术上你可以把几乎任何编解码器(如AV1视频)塞进MP4容器,尽管这并不常见。
JB指出,在实际应用中,VLC和FFmpeg基本不信任文件扩展名。一个标着“.mp4”的文件,内部可能是MOV或MKV的格式,甚至视频编码可能不是H.264。播放器的策略是:扩展名仅作为初始探测的提示,提高对应解析模块的优先级。但最终,它们会深入分析文件头的实际二进制数据,来判定真正的容器格式和编码类型。这种“不信任输入”的原则,是它们能够处理各种“奇怪”或损坏文件的关键。
VLC的哲学:在混乱的现实世界中保持坚韧
VLC为何能以“能播放一切”而闻名?这源于其诞生之初的设计哲学。JB回顾道,VLC最初是VideoLAN项目的一个客户端,用于接收网络流(通常是UDP协议)。网络传输中丢包是常态,因此必须处理不完整、损坏的输入数据。
这种“不信任输入,并对抗损坏”的理念被深深植入VLC的基因和文化中。它使得VLC在早期文件分享(盗版)盛行的时代大放异彩。当时常见的AVI格式,其元数据(索引)位于文件末尾。当用户从网上下载一个未完成的文件时,大多数播放器会因为找不到索引而无法播放。而VLC则会尝试主动解析、推测文件结构,尽最大努力播放出已有的内容。
“这就是VLC流行的原因之一。” JB说。这种鲁棒性设计,在今天看来也是优秀安全实践的体现——永远对输入进行严格的验证和容错处理。
编解码器的本质:榨干冗余的数学魔法
那么,视频编解码器究竟在做什么?其核心任务是消除视频数据中的冗余——包括空间冗余(同一帧内相邻像素的相似性)和时间冗余(相邻帧之间的相似性)。
JB用一个生动的例子解释时间冗余:在电影中,摄像机平移拍摄时,背景的云朵可能在几十秒内几乎没有变化。编码器可以只存储一次云朵的完整信息,在后续帧中只需指示“这里和上一帧的某部分相同”。同样,如果画面中有大面积的纯色背景(如黑色),编码器只需用极少的比特描述“这一大片区域都是黑色”。
压缩与解压缩是高度不对称的。Kieran强调,编码端通常比解码端需要高出几个数量级的计算力。这是因为编码器需要在海量的可能性中(如从过去数百帧的4K图像中寻找匹配块)做出最优决策,以找到最有效的压缩方式。而解码器只需按部就班地执行编码器指定的重建指令。这种不对称是合理的,因为一个视频通常只被编码一次,却可能被解码播放数百万次。
编解码器的设计充满了权衡:是追求极限压缩率(但解码复杂),还是追求快速编码(适合实时通讯)?是优化电影内容,还是优化屏幕录制或动画?JB指出,现代最先进的编解码器如AV1、VVC,实际上已不再是单一的算法,而是一个庞大的工具集合。它们包含了针对不同类型内容(自然视频、文字、动画)的多种编码工具。在视频通话中,当你从共享PPT切换到播放一段视频时,编码器可能会动态切换其内部使用的工具集,以达到当前内容的最佳压缩效果。
这场对话揭示了一个常被忽略的事实:我们每日享受的流畅高清视频体验,背后是数十年学术研究、工程实践和开源协作的结晶。从人类感知模型到复杂的数学变换,从比特流解析到GPU硬件加速,每一个环节都凝聚着无数工程师的智慧。FFmpeg和VLC,作为这个生态的核心支柱,以其开放性、鲁棒性和卓越性能,真正实现了“让所有人自由使用媒体”的愿景。
FFmpeg与VLC开发者对话:开源多媒体工具如何塑造视频时代撰文:Techub News 整理
在Lex Fridman的播客节目中,FFmpeg与VLC的核心开发者深入探讨了这两个几乎支撑起整个数字视频世界的开源项目。这场对话不仅揭示了其背后的技术原理,更触及了开源哲学、社区协作以及它们如何彻底 democratize(民主化)了视频创作与分发,重塑了从个人到巨头的媒体生态。
无处不在的“视频语言”:FFmpeg是什么?
FFmpeg本质上是一套用于多媒体处理的底层库和工具集。它的核心功能包括编解码(压缩与解压缩)、混流与分流(mux/demux)以及滤镜处理。在此基础上,它提供了一系列命令行工具,允许用户构建处理任何视频文件的“管道”。
开发者强调,FFmpeg几乎内嵌于所有你能想到的视频相关应用中:从VLC播放器到Chrome浏览器,从智能电视到在线流媒体平台。当你观看YouTube视频时,客户端和服务器端很可能都在使用FFmpeg。使用OBS录制直播?背后也是FFmpeg。许多专业级的大型视频处理设备,其内部也可能有FFmpeg在运行。
从哲学层面看,这创造了一个惊人的平等局面:你祖母的家庭录像和万亿美元公司的流媒体内容,本质上使用的是同一套技术栈。这些大公司可能只是运行着长达3000行的FFmpeg命令,或者调用其API。命令行工具`ffmpeg`本身堪称传奇,因为它提供了海量的参数,允许用户对一切进行定制。“它是一种语言,一种真正的编程语言,”开发者如此形容。甚至有大量用户开始借助AI来生成复杂的FFmpeg命令行,因为它能实现的滤镜和操作实在过于丰富。
对比图像处理领域,命令行层面缺乏一个像FFmpeg这样功能全面、覆盖广泛的工具(ImageMagick类似,但复杂度不及)。FFmpeg允许你在命令行完成类似Adobe After Effects的复杂视频效果,包括添加片头片尾、视频间淡入淡出(dip to black)、音频交叉溶解、硬编码字幕并自定义字体、进行各种音视频图层叠加等等。这一切神奇地兼容几乎所有编解码格式。
开源与社区:赋予全球个体力量的“运动”
FFmpeg和VLC的愿景一致:将技术上极其复杂的东西,变得让普通人、所有人都能轻松使用。用户将文件拖入VLC播放,或向FFmpeg输入带有复杂滤镜的任何内容,它们都能“魔法般”地工作,而用户无需感知背后的复杂性。
正是这类工具 democratize(民主化)了播客、流媒体和YouTube革命。开发者回忆,在90年代,你需要价值数十万美元、体积如汽车般的设备来完成视频压缩。如今,几乎每个人都站在了同一技术起跑线上。这赋予了无数人发声的能力,是一场真正的“运动”。
这场运动的核心是开源。开发者用了一个生动的比喻来解释开源:通常你买芝士蛋糕, bakery给你成品。开源则是给你蛋糕,同时给你食谱,还告诉你如何建造烤箱,并允许你修改食谱并转售他人。软件就是一个由无数细小指令组成的超长食谱。开源软件行业将这一切都给了你。
FFmpeg自诞生以来,大约有2000至3000人贡献过代码。它就像Linux内核一样,全球开发者主要在线协作,共同打造某个领域的最佳工具。有人发现某个编解码器不工作,就去修复它;有人想支持某种新文件格式,就去添加支持。这一切都是为了“更大的福祉”,惠及所有人。
开源许可证是社区的“社会契约”。社区成员除了在许可证上达成一致外,可能在其他方面意见不一,但许可证是他们协作的基础。它允许项目分叉(fork),也允许日后合并。许可证的种类繁多,主要分为两类:
宽松许可证(Permissive):如MIT、BSD、Apache,要求很少,允许使用者几乎任意使用代码,有些要求署名(Attribution),有些则不。
Copyleft许可证:要求将修改回馈社区,有不同程度的约束。较弱的如Mozilla公共许可证(MPL),较强的如GNU GPL,非常强的如AGPL。
选择何种许可证取决于项目目标和希望构建的社区形态。FFmpeg和VLC主要使用GPL或LGPL。Linux内核是GPL,Android是Apache,大量JavaScript框架使用MIT,BSD内核自然使用BSD许可证。
许可证变迁:从GPL到LGPL的商业与生态考量
许可证可以从更宽松转向更严格(因为你可以增加限制),但反之则不行(你不能将GPL代码放入MIT项目)。VLC的核心引擎libvlc曾从GPL改为LGPL,主要出于两个原因。
第一是商业集成。LGPL(库GPL)允许第三方应用程序使用libvlc(进而调用FFmpeg)而不必开源整个应用。这催生了围绕此技术的咨询和集成业务,例如将VLC引擎集成到游戏引擎或其他商业解决方案中。游戏开发者若想在游戏中播放视频,又不想被迫开源整个游戏代码,LGPL提供了可能。LGPL要求你回馈对该库本身的修改,但应用主体可以保持闭源。
第二是应用商店合规。Apple iOS App Store的条款使得GPL应用上架非常复杂,而LGPL应用则相对容易。因此,VLC在Windows、Mac和Linux上是GPL,但其核心是LGPL;而在iOS(iPhone和Apple TV版本)上,则使用了另一种许可证MPL。
改变许可证是一个极其艰巨的过程,因为它需要取得所有贡献者的同意。开源项目通常是“联合作品”(joint work),每个贡献者保留对其代码部分的版权。即使后续修改删除了某人的贡献,但只要新代码基于其原有工作,其版权依然存在。有些项目要求版权转让(copyright assignment),但FFmpeg/VLC这类社区项目不这样做。
为了将libvlc从GPL改为LGPL,开发者需要联系超过350位贡献者。这个过程有时非常困难且情感沉重。贡献者可能仅是电子邮件地址,需要多方追踪。开发者曾亲自前往一位贡献者的工作地点,却发现代码是由其已故的儿子编写的,需要向这位工厂工人解释开源的含义,并确保其理解这不是公司在掠夺代码。这类经历凸显了开源社区是由活生生的人组成的,尊重他们的贡献和权利至关重要。不尊重此过程、强行重新许可的行为会“摧毁社区的核心”,因为社区唯一共同认可的就是许可证本身。
社区本质:代码质量至上,无关身份
开源社区汇聚了来自世界各地、背景迥异的人群:从叙利亚战火中仅有间歇供电的贡献者,到各行各业、不同年龄、贫富的人们。许多贡献者是内向者,联系他们并获得邮件回复可能都很困难。
然而,社区的核心原则是只关心代码是否优秀,技术是否出色。“我们不在乎你是谁。抱歉,我们无从核查。也许你是一只狗,我也不在乎。我不在乎你来自哪里。我需要看你的代码。”开发者直言。当人们提交补丁(patch)被拒绝时,可能会不满,但社区的标准是代码质量,而非提交者的身份或所在公司的大小。这种对技术纯粹的追求,定义了社区,并吸引了众多背景独特、可能非常内向但技术精湛的贡献者。
正是这种对卓越技术的共同追求,以及开源模式带来的协作与共享,使得FFmpeg和VLC这样的工具能够持续进化,成为支撑当今视频时代的隐形基石,真正将强大的多媒体处理能力交到了每一个人手中。
FFmpeg 传奇开发者:那些用二进制考古学,为互联网视频奠基的“无名英雄”撰文:Techub News 整理
在2026 年 5 月Lex Fridman的播客中,FFmpeg项目的核心贡献者之一,揭开了这个被誉为“互联网视频基石”的开源项目背后波澜壮阔的历史。这不仅仅是一段技术演进史,更是一部关于极客精神、逆向工程的艺术,以及一群天才开发者如何通过破解二进制“黑盒”,为全球用户打通视频播放壁垒的英雄史诗。
从“格式战国”到“一统江湖”:FFmpeg的早期征程
在2000年代初期,互联网视频体验堪称一场噩梦。用户电脑上需要安装Real Player播放.rm文件,Windows Media Player播放.wmv文件,还有各种其他播放器处理DivX、Xvid等五花八门的MPEG-4 Part 2变体。每个播放器都体积臃肿,捆绑着广告甚至间谍软件。FFmpeg的出现,最初就是为了终结这种混乱。
早期关键人物Fabrice Bellard构思了项目,而2000年代的中坚力量则是Michael Niedermayer。他的核心成就是实现了对当时各种DivX、Xvid以及所有奇怪MPEG-4 Part 2变种的详尽支持。这不仅仅是添加几个解码器那么简单。当时中国CCTV系统可能使用一种古怪的MPEG-4 ASP变体,而欧洲的某个设备又使用另一种。Michael的任务是在支持这些独特变体的同时,确保不破坏其他所有格式的解码,这种边缘情况的数量多到超乎想象。
正是这种努力,使得用户第一次能够通过一个开源播放器(或播放库),无需安装任何“编解码器包”,就能流畅播放Xvid、DivX、Windows Media和RealPlayer格式的文件。这在当时本身就是一项巨大的成就,它让视频播放变得简单、干净、高效。
逆向工程的艺术:在数十兆字节的二进制“荒漠”中考古
随着H.264在2008年左右成熟并开启高清视频时代,FFmpeg迎来了它的“黄金年代”。这一时期的主角,是一群技艺超凡的逆向工程大师。他们面对的是各大公司紧闭大门的私有编解码器,任务是从编译好的二进制程序中,反推出完整的解码算法。
其中一位传奇人物是居住在德国的乌克兰工程师Kostya Shishkov。他被描述为“近乎天才”。当时,逆向工程一个1兆字节的二进制“blob”可能就需要一个月的工作量,而Kostya挑战的是20到30兆字节的庞然大物,并且是针对那些极其复杂和冷门的编解码器。
一个经典的例子是GoTo Meeting。这个视频会议软件使用自己的私有编解码器来录制会议,生成的WMV文件如果没有特定解码器,在其他播放器上只能看到黑屏或只有声音。对于依赖这些历史记录的企业或个人,这构成了严重的访问障碍。Kostya接下了这个悬赏任务,并在大约两个月内完成了逆向工程。他轻描淡写地解释方法:“哦,我看这段代码,它很像我在WMV里见过的DCT(离散余弦变换)……”更有趣的是,他编写的解码器代码里充满了内部笑话,埋藏着对同事的调侃,让这段“考古”成果显得生动而充满人性。
这个过程究竟有多难?逆向工程师就像数字考古学家,手持一把小刷子,试图从极少的信号中重建整个文明。他们需要:
定位与钩取:首先在庞大的视频会议客户端中找到负责解压缩的模块,并设法“钩入”该模块,使其能输出原始的YUV像素数据。这通常需要在反汇编器中摸索,猜测关键函数的位置。
获取“参考答案”:导出的YUV数据至关重要,因为它将成为后续逆向工程的“标准答案”。自己实现解码器后,输出必须与原始模块的输出做到比特级精确匹配。
在黑暗中摸索:打开反汇编器,凭借经验和直觉,在数百万条机器指令中寻找规律:哪里是DCT?哪里是熵解码?这个过程可能持续数周甚至数月,期间看不到任何图像输出,完全是在内存中进行逻辑调试和猜测,极易走入死胡同。
应对加密与DRM:有些二进制模块还会加密或带有数字版权管理保护,工程师可能需要运行在虚拟机中,在特定时刻暂停并转储内存来获取可分析的代码。
样本狩猎:逆向工程极度依赖样本文件。开发者常常需要在网上公开求助,寻找特定格式的罕见视频样本。运气好时,可能找到一个拥有数十万相关文件的公司,这就能全面测试编解码器的各种编码工具。
这种工作不仅需要顶尖的技术能力,更需要非凡的耐心和热情。正如访谈中所说,这些工程师“为了乐趣而做”,他们的工作确保了即使在未来几十年,当旧的操作系统和硬件都已淘汰,人们依然能访问今天的专有格式视频文件,这本质上是在为数字文明保存记忆。
比特精确与质量基石:FFmpeg的“钢铁”测试网
除了逆向工程,FFmpeg项目能成为行业事实标准,另一个基石是其严苛到极致的测试文化。从2000年代后的主流视频编码标准(如H.264)开始,都要求“比特精确”——即任何符合标准的解码器,对于同一个编码视频文件,必须输出完全一致的像素数据。这避免了MPEG-2时代因规范模糊导致的“兼容性”噩梦。
为了确保FFmpeg在无数平台和配置下的绝对可靠性,项目建立了名为FATE(FFmpeg Automated Testing Environment)的自动化测试系统。这套系统的规模和复杂程度令人咋舌。
庞大的异构矩阵:FATE并非简单的测试矩阵,而是一个由志愿者维护的、覆盖几乎所有可能组合的“枢轴表”。它包括不同的CPU架构(x86, ARM, PowerPC, RISC-V,历史上甚至包括DEC Alpha)、不同的操作系统(Linux各发行版、Windows、macOS、iOS、tvOS)、不同的编译器(GCC, Clang, Visual Studio, Intel编译器)及其众多版本。
全民共建:这些测试机器全部由社区志愿者托管。例如,访谈者本人就在办公室托管了一批Mac测试机。这种分布式协作确保了测试的广泛性。
捕获所有问题:FATE不仅能发现代码逻辑错误,甚至能捕捉到编译器自身的bug。有时,编译器会错误地编译某段C代码,导致输出异常。在视频解码中,由于帧间存在依赖,一个微小的像素错误可能会在后续帧中不断放大,造成严重的视觉瑕疵。FATE系统能及时发现并定位这类深层次问题。
正是这套近乎偏执的测试体系,保证了FFmpeg在任何角落都能稳定、精确地工作,赢得了从消费级应用到专业广播领域的绝对信任,最终实现了在多媒体解码领域的“赢家通吃”。相比之下,网页浏览器领域仍有多个渲染引擎并存,而FFmpeg几乎成为了解码事实上的唯一标准库。
传承与启发:开源社区的天才与谦逊
访谈中还提及了多媒体领域的另一位巨人——Yuri Resnik。他是一位拥有超过150篇论文和80多项美国专利的研究员,对H.264、H.265等主流标准贡献卓著。然而,更让人印象深刻的是他的谦逊与慷慨。他会热情地与年轻的创业者交流,分享见解,这种开放的精神与FFmpeg社区一脉相承。
这揭示了一个深刻的现象:FFmpeg社区里那些最顶尖的逆向工程专家和汇编优化大师,普遍有一种“举重若轻”的谦逊。他们面对常人看来如同天书般的难题,总是轻描淡写地说“哦,这个看起来像是……”。或许,正是因为他们的能力天花板太高,以至于在常人眼中的巨大挑战,在他们看来只是需要解决的“有趣问题”。
从Fabrice Bellard的创想,到Michael Niedermayer在混乱格式中的开拓,再到Kostya Shishkov等逆向工程大师的二进制考古,以及全球开发者共同维护的钢铁测试网,FFmpeg的故事是集体智慧的胜利。它告诉我们,驱动互联网基础架构前进的,不仅是商业公司的投入,更是全球开发者社区中,那些充满热情、技艺超群且默默无闻的天才们。他们用代码破解壁垒,用严谨确保可靠,最终让流畅的视频体验成为互联网的默认配置,彻底改变了人类沟通与娱乐的方式。
Unipeg 爆火出圈,全新双资产模式全解析撰文:道哥
“五一”期间,一个名为“Unipeg”(unipeg.art)的项目突然在网上走红。
这是一个基于 Uniswap V4 构建的项目。这个项目的机制非常独特,它既是 NFT,又是 ERC-20 代币。
说它是 NFT,是因为它和过往我们熟悉的 NFT 项目一样,也是总量为 1 万的艺术品(由像素组成的独角兽)。
但每个 NFT 的背后并不是我们熟知的 ERC-721 或者 ERC-1155 代币,而是锚定一枚完整的 Unipeg 代币(uPEG)。即当用户手里持有一枚完整的 Unipeg 代币时,他的钱包里就对应一个独角兽的图案。而这个 Unipeg 代币则是我们熟知的 ERC-20 代币。
所有的 Unipeg 代币都在 Uniswap 上交易。
当用户在 Uniswap 上买入 uPEG 代币后(比如买入 1.2 个 uPEG),其中的整数部分(1 个 uPEG)就会对应一个独角兽,而剩下的小数部分(0.2 个 uPEG)就成为代币碎片,不代表任何独角兽。
而如果用户将其持有的 1 枚 uPEG 零散卖掉,则这枚 uPEG 代表的独角兽就永久消失了。
同理,如果用户买入代币时,他买入的不是整枚数的 uPEG 代币,他也拿不到独角兽。
(关于这个代币和独角兽的形成机制可参看文后链接。)
在这种机制的作用下,一个必然发生的状况就是:独角兽会越来越少,最后 Uniswap 交易池中剩下的全部是 uPEG 的碎片代币。
由于这种独特的运作机制,项目被曝光后,参与者们纷纷抢购稀有的独角兽,导致代币价格在几天内就上涨了几十倍。
这个涨幅不管是在 NFT 赛道还是在 ERC-20 赛道都很久不见了。
项目火爆后还发生了一个“插曲”。
一个黑客利用了合约中的一个机制,巧妙地在短时间内反复洗盘,不断筛选出稀有的独角兽。这引发了代币持有者一阵恐慌性抛盘,导致价格大幅下跌,然后待事件稍微平息后,才逐渐企稳。
单纯就这个项目的 NFT 价值来说,按过往的经验,它的价格要能企稳并长线上涨,我觉得除非具备下列两个条件之一:
- 项目像加密朋克那样,在整个生态中具备无可挑剔并且强共识的唯一性和第一性。
- 项目能够渐渐衍生出一个庞大的生态,以至于未来任何参与这个生态的参与者都无法回避这个 NFT。
先看第一个条件。
回顾过往,在我们经历过的那么多 NFT 项目中(不管是以太坊生态还是比特币生态),真正能达到加密朋克那种唯一性和第一性的 NFT 实在太少了。
这个难度非常大。
就算曾经一度火爆异常的比特币 NFT 中,至今也很难找到能在历史价值上能够媲美加密朋克并且有强共识的 NFT。
所以这个独角兽要达到这个条件难度不小。
再看第二个条件。
除了加密朋克以外,绝大部分 NFT 要能长久维持价格并持续升值,需要一个能不断成长、壮大的生态。
我曾经对无聊猿寄予过厚望。但从这些年的实践看,至少到目前为止,它没有成功。
我曾经也对比特币生态寄予过厚望,相信如果比特币能成长出自己的生态,那里面的 NFT 也会有极大的潜力。但这些年的实践也证明,至少到目前为止,它也没有成功。
唯一一个还在持续发力并且时不时在 NFT 生态中掀起一个个小高潮的是胖企鹅(Pudgy Penguins)。
它一直在努力、一直在坚持,到目前为止也发力过多次。但每次发力持续的影响力并不长久,待影响力消退后,它的 NFT 又再度回落。
我只能说,这个项目还在坚持,但不能说它成功了。
所以从这个角度来看,这个独角兽的价值未来会如何,现在判断还太早了。
但如果跳开项目的投资价值,从生态创新来说,这个项目很了不起。
“DeFi 好就好在承载它的平台以太坊是个开放、无需许可的平台。只要有这个平台,创新的种子就一定会绵延不断地被种下,就一定会有那么极少数天才人物和天才团队会划过历史的长空,创造出一些异常强大的项目,永载史册”(4 月 22 日《我对 DeFi 的态度:当下谨慎,前途光明》)。
这个项目的创新就是 DeFi 生态中从未有过的创新,也是现实世界中从未见过的事物。
虽说这个创新到底有没有应用价值,到底能用在什么场合,现在我们还无法用实例和证据证明,但它恰恰再一次证明了这是个承载创新和随时可能爆发创新的平台。
只要有这样的平台,我们一定会再度看到令人惊奇的杰作,一定会再度看到颠覆世界的作品。
参考链接:
https://x.com/798_eth/status/2050019560125063290PSEG(PEG), 因预期1400亿韩元退税及连续15年增加股息……甚至出现欺诈警告,凸显“三轴战略”PSEG(PEG)正通过同时强调"客户保护"与财务表现、监管应对、扩大环保投资来提升存在感。从警告冒充公用事业公司的诈骗行为,到因监管胜诉带来的退款预期,再到股息上调与业绩增长,该公司通过发布复合型信息同时吸引了投资者和消费者的关注。
PSEG旗下的PSEG长岛公司近期警告称,以停电、停气为借口要求立即支付的"冒充公用事业公司"诈骗案正急剧增加。其解释称,诈骗手法已变得更为精巧,包括伪装电话号码、使用假身份证件、虚假网站以及在电动汽车充电器上粘贴伪造的二维码贴纸等。公司方面强调:"正规员工只会要求确认账户和'客户姓名',不会索要PIN码或个人敏感信息",并敦促客户直接通过客服中心(1-800-490-0025)进行核实。
在监管层面,也出现了积极进展。美国联邦能源监管委员会(FERC)于3月6日驳回了PJM电网输电费用重新分配的协议。PSE&G一直反对该协议,认为其将成本不当转嫁给了本公司客户。公司表示,此次决定预计将带来2020年至2022年间约1亿美元(约合1440亿韩元)的退款。若追溯重算至2015年,节省的规模预计将更大。业界评价称这是"将监管风险转化为实际成本节约的罕见案例"。
财务表现也保持稳健。PSEG在2025年实现净利润21.11亿美元(约合3.0392万亿韩元),每股收益4.22美元;非GAAP准则下的营业利润为20.29亿美元(约合2.9218万亿韩元),每股4.05美元。2026年的业绩指引定为每股4.28至4.40美元。同时,公司将年度股息上调至每股2.68美元,较上年增长约6%,这标志着其连续15年增加股息,并保持了119年的派息历史。
中长期投资计划也有所扩大。2026年至2030年的监管资本投资计划上调至225亿至255亿美元(约合32.4万亿至36.7万亿韩元),PSE&G的费率基础资产增长率(CAGR)目标设定为到2030年达到6%至7.5%。这被解读为同时推进电网稳定性和环保基础设施投资的战略。
环境、社会和治理(ESG)表现也得到强调。PSEG在2026年被评选为公用事业行业"公正资本"领导者,并在《新闻周刊》和Statista的评估中位列美国最具责任感企业第9名。此外,公司还入选了"美国捐赠最多的企业"榜单。公司在2018年至2025年间减少了约24.5万吨甲烷排放,仅在2025年一年就完成了1.5万小时的员工志愿服务和1280万美元(约合184亿韩元)的捐赠。
能效项目的成果同样显著。自2020年以来,约有48万客户参与,每年创造超过9亿美元(约合1.296万亿韩元)的电费节省效果,并实现了310万兆瓦时的电力节约和8000万撒姆的天然气节约。这相当于每年减少约230万吨的二氧化碳排放。
在组织层面,来自PG&E的前CEO盖莎·J·威廉姆斯加入董事会,为公司增添了35年的能源行业经验。长岛运营合同也延长至2030年,稳定的收益基础得到加强。该地区的停电频率和停电时长指标分别改善了26%和47%,并在客户满意度方面获得了高度评价。
评论 PSEG正通过应对监管议题、稳定股息、环保投资这"三大战略轴心",展现出超越传统公用事业公司局限的态势。特别是监管决定带来的成本退款以及长期投资的扩大,很可能成为未来股价估值重估的核心变量。
马斯克:NFT甚至不在区块链上 它只是指向JPEG的网址作者:Mlixy,W3C DAO
首先,让我们来看看Elon Musk在Joe Rogan的播客中到底说了什么。根据报道,他们在谈论NFT时,Musk说:
"The NFT is not even on the blockchain it’s just a URL to the JPEG. You should at least encode the JPEG in the blockchain. If the company housing the image goes out of business you don’t have the image anymore"
“NFT 甚至不在区块链上,它只是 JPEG 的 URL。你至少应该在区块链中对 JPEG 进行编码。如果存放图像的公司倒闭,你就不再拥有该图像了”。
Musk的这句话引发了很多争议和讨论,有些人认为他是在贬低NFT的价值和意义,有些人认为他是在揭露NFT的本质和局限。那么,Musk的话有没有道理呢?
我们需要从NFT和区块链的概念和技术来分析。
NFT是非同质化代币(Non-Fungible Tokens)的缩写,它是一种基于区块链技术的数字资产,具有唯一性、不可分割性、不可替代性等特点。NFT可以代表各种类型的数字内容,如图片、音乐、视频、游戏道具、艺术品等。NFT的出现,为数字内容创作者提供了一种新的确权和变现方式,也为数字收藏者提供了一种新的投资和鉴赏方式。
区块链是一种去中心化的分布式账本技术,它通过密码学和共识机制来保证数据的安全性、不可篡改性、可追溯性等特点。区块链上的数据以区块为单位进行存储和传输,每个区块都包含了前一个区块的哈希值(Hash)作为链接,形成了一个链式结构。区块链上的数据由网络中的多个节点共同维护和验证,不存在单点故障或中心化控制。
NFT是基于区块链技术实现的一种智能合约(Smart Contract),它是一种自动执行预设规则和逻辑的代码。NFT通过智能合约来定义数字内容的所有权、属性、转移规则等信息,并将其记录在区块链上。当用户购买或交易NFT时,就相当于在区块链上进行一次交易,将NFT对应的智能合约从一个地址转移到另一个地址,并支付相应的手续费。
那么,Musk说NFT只是一个指向JPEG的网址有没有道理呢?正确,但也有一定争议。
正确的部分在于,NFT本身并不存储数字内容本身,而只存储数字内容的元数据(Metadata),即关于数字内容的描述性信息。这些元数据通常包括数字内容的名称、作者、版权、时间戳等基本信息,以及数字内容所在位置的链接(URL)。
这个链接通常指向一个服务器上存储JPEG或其他格式文件的网址,也可能指向一个分布式存储网络(如IPFS)上存储文件的哈希值。因此,在某种意义上,NFT确实只是一个指向JPEG或其他文件的网址。如果指向中心化的服务器,这将有严重的风险。
争议的部分在于,NFT并不只是一个网址,而是一个包含了网址和其他信息的智能合约,它在区块链上有着明确的所有权和转移记录。
这意味着,NFT的拥有者可以通过区块链来证明自己对数字内容的所有权,也可以通过区块链来转让或授权自己的所有权。这是一个网址所不能提供的功能和价值。
因此,在另一种意义上,NFT并不只是一个网址,而是一个数字内容的防伪证书。
NFT的存储方式是由艺术家或平台来决定的,因此,NFT中所对应的照片、视频等文件完全可能存储在中心化的服务器,或去中心化存储上。
CryptoPunks:最初,CryptoPunks为了节省gas费用,将10000个字符聚合成一张图片,并将这张图片的哈希值存储在区块链上的智能合约中,但并未透露其原始数据的存储位置。随着NFT存储风险越来越受到关注,因此,CryptoPunks花费了7500万gas费用将所有头像存储在以太坊区块链上。
Bored Ape Yacht Club:Bored Ape Yacht Club共有10000个具有鲜明特色的猿人头像。所有头像均已铸造,可在二手交易平台上购买。BAYC在官网公布了每个头像的TokenID、SHA-256哈希值和IPFS哈希值。它还在去中心化的存储系统中备份了每个头像的媒体数据,并发布了备份信息。
这些例子展示了NFT可以采用不同的存储方式,包括中心化和去中心化等。
综上所述,Musk的话反映了NFT目前存在一定的问题,但可能忽略了NFT的另一部分真相。NFT既是一个指向JPEG或其他文件的网址,也是一个数字内容的防伪证书。它既有局限性,也有潜力。它既有挑战,也有机会。它既有争议,也有共识。
被盗6106枚wETH后成功追回,JPEG'd一人撑起NFT借贷赛道希望?今年下半年,NFT市场和整个加密领域迎来了一次深刻的低谷。NFT交易量急剧下降,与年初的火爆景象形成了鲜明的对比。市场陷入了似乎“无人问津”的状态,其中更为细分的NFT借贷市场更是被人们所遗忘。
近期NFT总交易量走势图
特殊的宏观环境下,JPEG'd却备受业内人士的关注。下面简单介绍下这一项目。
遭黑客攻击后化险为夷,JPEG'd用诚意和实力挽回用户信任
作为NFT借贷项目,JPEG'd曾被寄予厚望,但是在今年7月31日,JPEG'd的pETH-ETH Curve池遭到黑客攻击,损失惊人的6106枚wETH。这次攻击对JPEG'd项目造成了严重的影响,导致其pETH代币价格下跌了约50%。这一事件加剧了NFT借贷市场的困境,令人们对其前景产生了质疑。
与此同时,NFT市场遇到了严峻的挑战,其中一些项目面对困境,选择暂停或关闭他们的项目。但是JPEG'd选择了一种积极的态度,坚定地应对了这一困难局面。
对于任何项目来说,逆境都是一次严格的考验,它会测试项目的韧性。JPEG'd团队在这段时间里展现出了非凡的努力和毅力。在8月5日,JPEG'd成功追回了被盗的资金,总计5,549枚wETH。这一举措不仅证明了JPEG'd团队的专业素养,还表明了他们不愿轻易放弃的态度。他们没有选择被动接受挫折,而是积极采取了灾后重建的行动。
8月22日,JPEG'd团队采取了进一步的举措,发行了新的pETH代币,取代了原有的代币,并在Curve平台上部署了两个全新的池子。这一举措标志着pETH借贷系统的重新上线,为项目的复苏铺平了道路。
更为令人鼓舞的是,于9月14日,JPEG'd项目正式重启,同时推出了代币激励计划,并减免了费用。这一系列的行动使JPEG'd项目重新焕发生机,吸引了更多用户的参与,为其未来的发展带来了新的活力。
JPEG'd的坚韧和努力,以及他们成功克服逆境的经验,为NFT借贷市场提供了一个重要的案例研究。这一经历展示了在市场波动剧烈的情况下,项目可以采取的积极措施,并为其他项目提供了宝贵的启示。在NFT行业这个不断发展和变化的领域,JPEG'd展现出了创新者的精神,坚守初心,不断前进。这种积极的态度和韧性,将继续推动着NFT借贷市场朝着更加繁荣的未来前进。
从数据上看,JPEG'd被低估,目前JPEG'd全稀释市值为4333万美金,低于其协议金库持有资产6124万美金。
JPEG'd协议金库持有资产走势图
另外一个令人鼓舞的迹象是,JPEG'd的TVL(Total Value Locked,总锁定价值)出现了显著的增长。在过去的一个月里,JPEG'd的TVL实现了47.13%的涨幅,这使得它跻身了NFT借贷市场的前三名。表明了用户对JPEG'd的信心正在逐渐恢复。
NFT借贷市场排名图,JPEG'd位列第三
综合来看,JPEG'd已经成功走出了被黑客攻击事件的阴影,恢复了元气。尽管遭遇了严重的挫折,但这个项目通过坚定的决心和积极的行动,成功应对了逆境。其市值低估和TVL的快速增长,使其投资价值变得明显。
从NFT借贷协议大环境,看JPEG'd机制和模式的优劣势
与现实世界的房地产一样,NFT也面临着相对较低的流动性问题。为了合理释放存量NFT的流动性,NFT借贷协议应运而生,赋予了NFT金融属性,提高了NFT的流动性,同时也拓宽了NFT的应用领域。
通过NFT借贷协议,用户能够抵押NFT以获取稳定币,从而实现贷款;用户还可以将资金提供给平台,赚取相应的收益,同时将NFT作为抵押。基于这一基础,NFT借贷市场还衍生出了杠杆借贷、质押、租赁等多种玩法,为NFT提供了新的金融服务和应用,进一步推动了NFT市场的发展。
目前,主要存在三种主要的NFT借贷方式:
1、点对点借贷:用户在平台上发布借款挂单,然后自行与其他用户成交。代表项目包括NFTfi和X2Y2;
2、点对池借贷:用户将NFT抵押,然后从流动性池中借取以太坊。代表项目包括Benddao;
3、点对协议借贷:用户将NFT抵押给协议,然后从协议中借取协议发行的资产。代表项目包括JPEG'd。
BendDAO和JPEG'd都采用了超额抵押借贷的模式,但它们之间存在一些微妙的差异:
BendDAO采用点对池模式,借款人直接与平台的贷款池进行互动,使用NFT作为抵押,以获取ETH。当抵押的NFT价格下跌到一定程度时,可能触发清算。贷款池中的ETH来自存款人的存款,存款人作为平台的流动性提供者可以获得利息收入。
JPEG'd则采用了点对协议模式,用户通过抵押NFT获得JPEG's的原生代币pETH或pUSD,然后可以将其用于Curve、Convex等DeFi平台,以换取ETH、稳定币或进行流动性挖矿,从而获取更高的收益。
需要指出的是,JPEG'd的业务逻辑与MakerDAO相似,而Benddao的业务逻辑则类似于AAVE。
JPEG'd拥有一些显著的优势:
1、它是当前NFT借贷市场中抵押借贷利率最低的平台;
2、JPEG'd的原生代币pETH在Curve、Convex等平台上提供了非常高的LP(流动性提供)收益率,这也是项目业务增长的主要动力之一;
3、与BendDao相比,JPEG'd的抵押借贷最高比例更高,为用户提供了更大的灵活性。
NFT借贷市场机遇无限,赛道内创新项目将为行业带来增量价值
NFT借贷市场,如同NFT本身一样,正在经历着快速而动态的发展。尽管这个市场曾遭遇了挫折和逆境,但它仍然充满着巨大的潜力。NFT借贷协议的出现,为NFT注入了金融属性,提高了其流动性,同时也为NFT赋予了更多的用例,使其不仅仅是数字艺术品,还是一种金融工具。
在这个市场中,JPEG'd作为一个备受关注的项目,经历了黑客攻击和重启,展现出了坚韧和适应力。其低利率、高LP收益率以及更大的抵押借贷比例,为其赢得了一定的市场份额,并吸引了众多投资者的青睐。
尽管市场前景充满希望,但我们也必须认识到,NFT借贷市场仍然处于发展的早期阶段,存在一定的不确定性和风险。项目的安全性、可持续性以及监管环境都是需要密切关注的因素。投资者和用户应该充分了解每个项目,谨慎评估风险,做出明智的决策。
总的来说,NFT借贷市场将继续发展壮大,为数字艺术品和NFT持有者提供更多的选择和机会。JPEG'd的经历令人鼓舞,也是这个市场坚韧和创新精神的象征。未来,我们可以期待更多的创新和发展,为NFT借贷市场带来更多可能性,同时也期待着这个市场能够更好地满足用户的需求,为数字艺术和区块链生态系统的繁荣贡献更多力量。
Pegasus Bot:基于Arbitrum,人工智能驱动的Telegram交易机器人Pegasus是一个基于Arbitrum旨在为反应迅速的交易者提供自动化解决方案的加密项目,当有关目标代币的有影响力的推文出现在X上时,可以在链上下买单和卖单。Pegasus机器人将集成到Telegram消息平台中,方便用户访问和使用。Pegasus提供了一个自动化和响应式的解决方案,供希望通过X上分享的信息来做出明智的交易决策的交易者使用。通过在Telegram上轻松集成和注重安全性的方法,Pegasus为用户提供流畅而安全的体验。
机制分析
PegasusBot不断监测来自加密货币社区中各种有影响力的人士的推文。通过利用OpenAI的自然语言处理能力,该机器人能够识别可能影响去中心化金融代币价格的推文。根据这种分析,PegasusBot自动执行期货的买入和卖出订单,为用户提供及时的交易机会。
自动杠杆交易
PegasusBot 利用自动化的力量通过 GMX 平台对加密代币执行杠杆头寸。这消除了交易者手动跟踪市场和进行交易的需要,节省了宝贵的时间并降低了错失有利可图的机会的风险。
基于Twitter的情报
利用OpenAI的专业知识,PegasusBot利用先进的算法来分析来自信誉良好的来源的推文,并确定它们与市场的相关性。通过依靠人工智能选择的推文,交易者可以访问实时的、数据驱动的见解,为他们的交易决策提供信息。
无情感交易
在加密交易世界中,情绪通常会影响判断。PegasusBot消除了等式中的情绪偏见,仅根据数据和市场信号做出理性决策。这导致了更规范和一致的交易策略。
多元化投资组合管理
PegasusBot使交易者能够通过同时管理多个杠杆头寸来有效地分散其加密投资组合。这种多元化策略有助于分散风险并增强利润潜力。
对用户的好处
PegasusBot的用户可以获得通过实时交易信号和通过情绪分析得出的有价值的见解,这些信息使用户能够做出明智的交易决策,并有可能从市场动态新闻中获利。此外,PegasusBot还提供独家访问高级功能和个性化支持,以提升用户的交易体验。
对关键信息的响应能力:Pegasus用户可以立即对通过X分享的重大新闻做出反应,从而有可能在市场上获得优势。
自动交易:Pegasus机器人消除了持续监控社交媒体以检测交易机会的需要,使用户可以专注于其他活动。
用户友好的体验:与电报集成后,Pegasus机器人可以从任何兼容设备访问,提供便捷的用户体验。
选择Arbitrum生态原因
可扩展性和速度
Arbitrum是以太坊的第二层扩展解决方案,旨在提高可扩展性并降低交易成本。通过在Arbitrum上启动,PegasusBot可以利用其高吞吐量和快速交易确认时间,为用户提供流畅高效的体验。
降低交易成本
Arbitrum网络利用乐观汇总,与以太坊主网相比,这大大降低了gas费用。这意味着与PegasusBot交互的用户的交易成本更低,使其更实惠,更容易被更广泛的受众使用。
增强用户体验
通过快速的交易确认和降低的费用,在Arbitrum上启动可以增强整体用户体验。用户可以享受更快的交互、无缝的收益生成和高效的代币交换,从而提高参与度和满意度。
稳定性
Arbitrum通过紧密集成继承了以太坊主网的安全性。用户可以从以太坊网络的稳健性和久经考验的性质中受益,确保其交易和资产的安全性和完整性。
GMX
在Arbitrum生态系统内的GMX平台上进行交易为用户提供更快,更具成本效益和安全的交易体验,并以以太坊的稳健性和兼容性为后盾。该平台的可扩展性、低费用和用户友好的界面使其成为希望在去中心化金融领域优化其交易活动的交易者的有吸引力的选择。
特征
AI驱动
Pegasus利用OpenAI先进的自然语言处理技术的力量来分析推文并确定可能影响加密市场的趋势。
链上订单执行
当确定相关趋势时,Pegasus机器人会根据用户设置的参数,通过为相应的代币下链上买入或卖出订单来立即自动做出反应。
账户抽象技术
这个概念将账户的概念与区块链系统中的执行模型分开。它使智能合约能够直接控制其他智能合约并与之交互,从而在去中心化应用程序中提供更大的灵活性和互操作性。
$PGS
Pegasus($PGS)代币是PegasusBot项目的原生加密货币。它建立在Arbitrum区块链上,并遵循ERC-20标准。作为ERC-20代币,它受益于以太坊生态系统的稳健性和广泛的兼容性。
安全
Pegasus机器人非常重视安全性。借助账户抽象技术,所有用户的资金都将通过经过验证的智能合约得到保护。我们的用户不需要KYC,协议将是100%去中心化和透明的。
Tokenomics
Pegasus($PGS)代币是PegasusBot项目的原生加密货币。它建立在Arbitrum区块链上,并遵循ERC-20标准。作为ERC-20代币,它受益于以太坊生态系统的稳健性和广泛的兼容性。$PGS将在Arbitrum网络上的主要去中心化交易所进行交易。
$PGS分配表
总供应量
1000万
种子轮供应量
500万
LP 供应量
400万
面向CEX
50万
团队及合作伙伴
50万
Roadmap
技术
启动交易到GMX上不可用的新资产。
使用GLP生成现金奖励和收益。
xPGS代币作为收益共享代币。
向飞马机器人添加DeFi代币狙击功能。
通过不同平台实现去中心化期权合约的仓位自动化。
市场营销
平台列表(CoinGecko、Coinbase等)
官方合作伙伴
Summary
PegasusBot是在Telegram平台上开发的一款创新的AI驱动交易机器人。它利用包括OpenAI在内的先进技术,分析加密货币领域中具有影响力的推文。PegasusBot基于情感分析和市场趋势提供实时交易信号,为DeFi行业的交易者提供支持,并由OpenAI提供动力。但是,交易者在使用任何自动交易机器人之前应始终谨慎并进行彻底的研究。
JPEG'd已收到白帽黑客返还的5494.4枚WETH8月5日消息,DeFi公共产品JPEG'd发推称,DAO多签地址确认收到5494.4枚WETH,从pETH漏洞中追回资金的地址所有者获得了10%(610.6枚WETH)的白帽赏金。撰文:Techub News 整理 在Lex Fridman的播客中,两位开源多媒体领域的重量级人物——传奇播放器VLC的首席开发者Jean-Baptiste Kempf(JB)和FFmpeg项目的核心贡献者Kieran Kunhya——进行了一场深度技术对话。他们拆解了从点击播放到画面呈现的「黑盒」过程,解释了为何视频压缩能高达千倍,并分享了FFmpeg与VLC如何成为互联网视频基础设施的基石。对于任何希望理解数字媒体底层逻辑的人,这都是一次不可多得的知识盛宴。 从点击播放到画面呈现:不为人知的复杂旅程 当你用VLC打开一个视频文件或点击一个流媒体链接时,一个庞大而精密的技术机器便开始无声运转。JB概括了整个过程:首先,播放器需要从一个地址(如URL、本地文件路径或DVD)获取原始数据流。这是与操作系统交互的第一步,得到的是一个连续的字节流。 接下来是关键的一步:解复用。容器(如MP4、MKV)就像一个包裹,里面封装了视频、音频、字幕等多个轨道的数据流。解复用器(Demuxer)的任务就是拆开这个包裹,将混杂的数据流分离成独立的视频流、音频流等。Kieran指出,这仅仅是开始,后续每一步都蕴含着巨大的复杂性。 分离出压缩的视频数据后,播放器需要判断使用何种方式解码。一个常见的误解是GPU硬件解码能处理一切。JB透露,实际上高达45%的视频文件无法被GPU解码,必须回退到软件解码。播放器需要探测视频流的编码语法,识别其具体变种,并比对不同GPU厂商的支持能力,才能做出正确决策。 如果使用软件解码,核心的数学解码过程便开始了。首先是熵解码,即使用霍夫曼编码或算术编码等方法,将高度压缩的比特流进行第一步解压缩。然后进入帧内预测阶段,处理视频中的关键帧(I帧)。I帧是空间域上的完整图像,解码器需要预测每个图像块,但预测总与真实值有差异,这个差异被称为残差。残差信息通常存储在频率域中并经过量化,解码器需要做反量化、反变换,将其转换回空间域,再与预测值相加,最终重建出原始图像块。 这只是静态图像(I帧)的解码。视频压缩的魔力更多体现在时间压缩上。通过运动估计与补偿,编码器只需存储帧与帧之间的变化部分,而非每一帧的完整信息,从而实现了巨大的压缩比。解码器则根据这些运动向量和残差信息,从已解码的参考帧中预测出当前帧。 最后,解码出的原始图像(通常是YUV色彩空间)需要经过色彩空间转换、缩放等后处理,再通过显卡渲染到屏幕上。音频流也经历类似的解码过程,最终通过声卡输出。正如Kieran所感慨的:“我们刚才描述的每一句话,都是某些人毕生的工作。每一句话背后都有专著论述,都有成千上万的行业人员在研究。” 压缩的艺术:为人类感知而“降级” 视频与音频压缩的目标与传统的文件压缩(如ZIP)有本质区别。ZIP追求无损,输入输出数据必须完全一致。而多媒体压缩是有损的,其核心哲学是在人类感知允许的范围内,尽可能多地剔除“不重要的”信息。 JB用数字说明了这种压缩的极端程度:从普通音频到MP3,压缩比大约是10倍。而视频压缩,目标则是惊人的200倍乃至1000倍。为了实现这种级别的压缩,必须深入理解人类感官的工作原理。 “所有编解码器,无论是音频还是视频,本质上都是在模仿人类的耳朵和眼睛的工作方式。” JB解释道。例如,视频编码并不直接处理常见的RGB色彩空间,而是使用YUV。Y代表亮度(Luminance),UV代表色度(Chrominance)。这模仿了人眼视网膜中视杆细胞(对明暗敏感)和视锥细胞(对颜色敏感)的不同特性。基于此,编码器可以大幅降低色度分量的分辨率(例如使用4:2:0采样),在不引起明显视觉察觉的情况下,直接将数据量减半。 随后,编码器运用强大的数学工具进行变换。最经典的是将图像块从空间域转换到频率域的离散余弦变换。在频率域中,能量集中在少数低频系数上,高频系数(代表细节)则可以被更激进地量化甚至丢弃。这就是为什么在低码率或解码错误时,我们看到的不是模糊,而是出现明显的“方块”——因为解码丢失了每个图像块内的高频细节。 Kieran补充了编解码器发展的一个关键趋势:每一代新标准(如从H.264到H.265/HEVC,再到AV1)通常能在相同画质下带来约30%的码率节省。但这节省的代价是巨大的。“为了提升这30%的效率,所需的编码计算复杂度可能增加一个甚至两个数量级。” 这意味着更强大的CPU/GPU和更长的编码时间。 容器与编解码器:被行业混淆的“房子”与“家具” 一个普遍的技术混淆点在于容器格式和视频编解码器。JB和Kieran对此进行了澄清。 容器(如MP4、MKV、MOV、AVI)就像一栋房子,它是一个封装格式,内部可以容纳视频轨、音频轨、字幕轨等多种数据流。容器的另一个名称是“复用器”(Muxer),而解封装的过程就是“解复用”(Demux)。 编解码器(Codec,编码器/解码器合称)则像是房子里的家具,如H.264、AV1、AAC等,是实际对音视频数据进行压缩和解压缩的算法。 “人们经常把MP4和H.264搞混,这其实不能全怪用户。” Kieran说,这很大程度上是行业命名混乱造成的。H.264的官方标准名是MPEG-4 Part 10(高级视频编码,AVC)。而MPEG-4是一个庞大的标准家族,其中还包含MPEG-4 Part 2(一种较老的视频编码)、AAC音频编码等。MP4容器则是基于MPEG-4标准定义的另一种东西。因此,技术上你可以把几乎任何编解码器(如AV1视频)塞进MP4容器,尽管这并不常见。 JB指出,在实际应用中,VLC和FFmpeg基本不信任文件扩展名。一个标着“.mp4”的文件,内部可能是MOV或MKV的格式,甚至视频编码可能不是H.264。播放器的策略是:扩展名仅作为初始探测的提示,提高对应解析模块的优先级。但最终,它们会深入分析文件头的实际二进制数据,来判定真正的容器格式和编码类型。这种“不信任输入”的原则,是它们能够处理各种“奇怪”或损坏文件的关键。 VLC的哲学:在混乱的现实世界中保持坚韧 VLC为何能以“能播放一切”而闻名?这源于其诞生之初的设计哲学。JB回顾道,VLC最初是VideoLAN项目的一个客户端,用于接收网络流(通常是UDP协议)。网络传输中丢包是常态,因此必须处理不完整、损坏的输入数据。 这种“不信任输入,并对抗损坏”的理念被深深植入VLC的基因和文化中。它使得VLC在早期文件分享(盗版)盛行的时代大放异彩。当时常见的AVI格式,其元数据(索引)位于文件末尾。当用户从网上下载一个未完成的文件时,大多数播放器会因为找不到索引而无法播放。而VLC则会尝试主动解析、推测文件结构,尽最大努力播放出已有的内容。 “这就是VLC流行的原因之一。” JB说。这种鲁棒性设计,在今天看来也是优秀安全实践的体现——永远对输入进行严格的验证和容错处理。 编解码器的本质:榨干冗余的数学魔法 那么,视频编解码器究竟在做什么?其核心任务是消除视频数据中的冗余——包括空间冗余(同一帧内相邻像素的相似性)和时间冗余(相邻帧之间的相似性)。 JB用一个生动的例子解释时间冗余:在电影中,摄像机平移拍摄时,背景的云朵可能在几十秒内几乎没有变化。编码器可以只存储一次云朵的完整信息,在后续帧中只需指示“这里和上一帧的某部分相同”。同样,如果画面中有大面积的纯色背景(如黑色),编码器只需用极少的比特描述“这一大片区域都是黑色”。 压缩与解压缩是高度不对称的。Kieran强调,编码端通常比解码端需要高出几个数量级的计算力。这是因为编码器需要在海量的可能性中(如从过去数百帧的4K图像中寻找匹配块)做出最优决策,以找到最有效的压缩方式。而解码器只需按部就班地执行编码器指定的重建指令。这种不对称是合理的,因为一个视频通常只被编码一次,却可能被解码播放数百万次。 编解码器的设计充满了权衡:是追求极限压缩率(但解码复杂),还是追求快速编码(适合实时通讯)?是优化电影内容,还是优化屏幕录制或动画?JB指出,现代最先进的编解码器如AV1、VVC,实际上已不再是单一的算法,而是一个庞大的工具集合。它们包含了针对不同类型内容(自然视频、文字、动画)的多种编码工具。在视频通话中,当你从共享PPT切换到播放一段视频时,编码器可能会动态切换其内部使用的工具集,以达到当前内容的最佳压缩效果。 这场对话揭示了一个常被忽略的事实:我们每日享受的流畅高清视频体验,背后是数十年学术研究、工程实践和开源协作的结晶。从人类感知模型到复杂的数学变换,从比特流解析到GPU硬件加速,每一个环节都凝聚着无数工程师的智慧。FFmpeg和VLC,作为这个生态的核心支柱,以其开放性、鲁棒性和卓越性能,真正实现了“让所有人自由使用媒体”的愿景。
