尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【论文阅读】论文阅读-加密流量-ETBERT-林欣杰熊刚-WWW2022-CCFA会议

【论文阅读】论文阅读-加密流量-ETBERT-林欣杰熊刚-WWW2022-CCFA会议 ET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic ClassificationET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic ClassificationET-BERT:一种基于预训练 Transformer 的上下文化数据报表示方法用于加密流量分类林欣杰¹,²,熊刚¹,²,苟高鹏¹,²,李振¹,²,史俊正¹,于静¹,²*¹ 中国科学院信息工程研究所,北京,中国² 中国科学院大学网络空间安全学院,北京,中国Xinjie Lin1,2 , Gang Xiong1,2 , Gaopeng Gou1,2 , Zhen Li1,2 , Junzheng Shi1 , Jing Yu1,2∗ . 2022. ET-BERT: A Contextualized Datagram Representation with Pre-training Transformers for Encrypted Traffic Classification. In *Proceedings of the ACM Web Conference 2022 (WWW ’22), April 25–29,2022, Virtual Event, Lyon, France.ACM, New York, NY, USA, 10 pages. https://doi.org/10.1145/3485447.3512217图1:加密流量分类方法的四类主要范式:(a) 基于明文特征的指纹匹配;(b) 基于统计特征的机器学习;© 基于原始流量特征的机器学习;(d) 基于原始流量的预训练方法。摘要加密流量分类需要从内容不可见且类别不平衡的流量数据中提取具有判别性和鲁棒性的流量表征,以实现高精度分类——这虽极具挑战性,却是保障网络安全与网络管理不可或缺的基础能力。现有方法的主要局限在于:过度依赖深度特征,而这些特征往往严重受限于训练数据规模,在面对未见过的数据时泛化能力弱。如何有效利用开放域中的无标签流量数据,学习具备强泛化能力的表征,仍是当前的关键难题。为此,本文提出一种新型流量表征模型——基于 Transformer 的加密流量双向编码器表征(Encrypted Traffic Bidirectional Encoder Representations from Transformer,ET-BERT)。该模型通过大规模无标签数据进行预训练,学习深度上下文感知的数据报级(datagram-level),随后仅需少量任务相关标注数据进行微调,即可在多种加密流量分类任务上达到最先进性能(state-of-the-art):ISCX-VPN-Service数据集:F1 分数达98.9%(↑5.2%)Cross-Platform(Android):F1 分数达92.5%(↑5.4%)CSTNET-TLS 1.3:F1 分数达97.4%(↑10.0%)尤为关键的是,本文通过分析加密流量中密文的随机性,对 ET-BERT 强大的预训练效果提供了可解释性,更深入了解了加密流量分类能力的边界。代码开源:https://github.com/linwhitehat/ET-BERT🔑核心创新与关键技术亮点(突出强调)首创“流量版 BERT”架构首次将Transformer 预训练范式引入加密流量分析领域,提出ET-BERT模型。实现从无标签大数据中自监督学习通用流量表征,突破传统监督学习对标注数据的依赖。两大自监督预训练任务(隐含于关键词)**Masked BURST Model **(MBM):类比 BERT 的掩码语言建模,预测被遮蔽的突发序列(burst);**Same-origin BURST Prediction **(SBP):预测来自同一源的 burst 序列,学习流量上下文一致性。小样本高效微调在极少量标注数据下即可适配新任务,显著降低部署成本,解决实际场景中标注稀缺问题。性能大幅提升在多个权威数据集上 F1 分数提升 5.2%~10.0%,尤其在 TLS 1.3 等高混淆协议上效果显著。理论可解释性突破通过密文随机性分析,首次从信息论角度解释为何某些加密流量本质上难以分类,为领域研究划定能力边界。关键词Encrypted Traffic Classification→ 加密流量分类Pre-training→ 预训练Transformer→ Transformer 架构Masked BURST Model(MBM) → 掩码突发序列建模Same-origin BURST Prediction(SBP) → 同源突发序列预测1 引言网络流量分类旨在识别来自不同应用或网络服务的流量类别,是实现高效网络管理与网络安全保障的关键技术之一 [4, 32]。近年来,为保护用户隐私与匿名性,流量加密技术被广泛采用。然而,这也给流量分类带来了严峻挑战——恶意流量和网络攻击者可借助 Tor、VPN 等增强型加密手段规避监控系统。传统的深度包检测(Deep Packet Inspection, DPI)方法依赖从数据包载荷中提取关键词或模式,在面对完全加密流量时已失效。此外,随着加密技术的快速演进(如 TLS 1.3 的普及),针对特定加密协议设计的分类方法难以适应新环境或未知的加密策略 [27]。因此,如何从多样化的加密流量中挖掘隐含且鲁棒的判别模式,并支持高精度、强泛化能力的通用分类,已成为提升网络安全水平与网络管理效能的核心问题。[4] Tomasz Bujlow, Valentín Carela-Español, and Pere Barlet-Ros. 2015. Independent Comparison of Popular DPI Tools for Traffic Classification.Computer Networks76 (2015), 75–89.[32] Hongtao Shi, Hongping Li, Dan Zhang, Chaqiu Cheng, and Xuanxuan Cao. 2018. An Efficient Feature Generation Approach Based on Deep Learning and Feature Selection Techniques for Traffic Classification.Computer Networks132 (2018), 81–98.[27] Shahbaz Rezaei and Xin Liu. 2019. Deep Learning for Encrypted Traffic Classification: An Overview.IEEE Communications Magazine57, 5 (2019), 76–81如图1所示,加密流量分类研究经历了显著的技术演进:早期方法[35] 利用加密流量中**残留的明文信息(如 TLS 证书、SNI 字段)**构建应用指纹,并通过指纹匹配实现分类(图1(a))。然而,随着 TLS 1.3 等新一代协议对明文信息的进一步压缩与混淆,此类方法逐渐失效。为应对无明文场景,部分研究 [25, 34] 转向提取统计特征(如包长序列、时序间隔、方向分布等),并结合传统机器学习模型进行分类(图1(b))。但这类方法高度依赖专家手工设计特征,泛化能力有限。近年来,深度学习方法 [19, 20] 直接从原始流量字节序列中自动学习复杂模式(图1©),显著提升了分类性能。然而,其性能严重受限于标注数据的数量与分布,易产生模型偏置,难以适应新型加密协议或跨平台场景。[35] Thijs van Ede, Riccardo Bortolameotti, Andrea Continella, Jingjing Ren, Daniel J. Dubois, Martina Lindorfer, David R. Choffnes, Maarten van Steen, and Andreas Peter. 2020. FlowPrint: Semi-Supervised Mobile-App Fingerprinting on Encrypted Network Traffic. InAnnual Network and Distributed System Security Symposium.[25] Andriy Panchenko, Fabian Lanze, Jan Pennekamp, Thomas Engel, Andreas Zinnen, Martin Henze, and Klaus Wehrle. 2016. Website Fingerprinting at Internet Scale. InAnnual Network and Distributed System Security Symposium.[34] Vincent F. Taylor, Riccardo Spolaor, Mauro Conti, and Ivan Martinovic. 2018. Robust Smartphone App Identification via Encrypted Network Traffic Analysis.IEEE Transactions on Information Forensics and Security13, 1 (2018), 63–78.[19] Kunda Lin, Xiaolong Xu, and Honghao Gao. 2021. TSCRNN: A Novel Classification Scheme of Encrypted Traffic Based on Flow Spatiotemporal Features for Efficient Management of IIoT.Computer Networks190 (2021), 107974.[20] Chang Liu, Longtao He, Gang Xiong, Zigang Cao, and Zhen Li. 2019. FS-Net: A Flow Sequence Network For Encrypted Traffic Classification. InIEEE Conference on Computer Communications. 1171–1179.与此同时,预训练模型在自然语言处理 [6]、计算机视觉 [8] 及众多其他领域 [2, 17] 取得了突破性进展。其核心思想是:利用大规模无标签数据学习通用、无偏的数据表示,并通过在少量下游任务标注数据上微调,实现高效迁移。在加密流量分类领域,最新工作 [12] 首次尝试引入预训练技术,在 VPN 流量分类上取得明显提升,但其缺乏面向网络流量特性的专用预训练任务与合理的输入表示形式,未能充分释放预训练模型的潜力。[6] Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Inthe North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 4171–4186.[8] Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. InInternational Conference on Learning Representations.[2] Emily Alsentzer, John R. Murphy, Willie Boag, Wei-Hung Weng, Di Jin, Tristan Naumann, and Matthew B. A. McDermott. 2019. Publicly Available Clinical BERT Embeddings. Inthe Clinical Natural Language Processing Workshop. 72–78.[17] Jinhyuk Lee, Wonjin Yoon, Sungdong Kim, Donghyeon Kim, Sunkyu Kim, Chan Ho So, and Jaewoo Kang. 2019. BioBERT: A Pre-trained Biomedical Language Representation Model for Biomedical Text Mining.Bioinformatics36, 4 (2019), 1234–1240.[12] Hong Ye He, Zhi Guo Yang, and Xiang Ning Chen. 2020. PERT: Payload Encoding Representation from Transformer for Encrypted Traffic Classification. InITU Kaleidoscope: Industry-Driven Digital Transformation. 1–8.为此,本文提出一种面向加密流量分类的新型预训练模型——加密流量双向编码器表示(Encrypted Traffic Bidirectional Encoder Representations from Transformer,ET-BERT),旨在从大规模无标签加密流量中学习通用的报文级表示(图1(d))。具体而言:我们首先设计了一种原始流量表示模型,将网络报文转化为类语言的Token 序列;每条流量流被组织为一种传输引导的结构单元,称为BURST,作为模型输入;整体框架包含预训练与微调两个阶段:在预训练阶段,基于 Transformer 架构的网络通过自监督学习,在大规模无标签加密流量上学习通用表示;为此,我们创新性地提出两项面向流量特性的自监督预训练任务:掩码 BURST 模型(Masked BURST Model, MBM):建模同一 BURST 内不同字节间的上下文相关性;同源 BURST 预测(Same-origin BURST Prediction, SBP):捕捉前后 BURST 之间的传输时序关系;在微调阶段,ET-BERT 可适配各类具体分类任务,仅需少量任务相关标注数据即可完成参数优化。本文主要贡献如下:提出首个面向加密流量分类的预训练框架,利用大规模无标签加密流量学习通用报文表示,可迁移至多种下游分类任务;设计两项流量专属的自监督预训练任务(MBM 与 SBP),分别从字节级与BURST 级建模上下文依赖关系,有效捕获加密流量的内在结构模式;ET-BERT 展现出卓越的泛化能力,在五项具有代表性的加密流量分类任务上均取得当前最优性能(state-of-the-art),包括:通用加密应用分类(General Encrypted Application Classification)加密恶意流量分类(Encrypted Malware Classification)VPN 场景下的加密流量分类Tor 网络中的应用分类TLS 1.3 协议下的应用分类相较现有方法,F1 分数分别提升5.4%、0.2%、5.2%、4.4% 和 10.0%;提供对预训练模型强大性能的理论解释与分析,通过研究加密套件的随机性特性,深入探讨加密流量分类能力的理论边界。关键术语说明(供参考):BURST:指一次连续的数据突发传输单元,通常由多个方向一致、时间紧密相连的数据包组成,是建模流量行为的重要粒度。**Masked BURST Model **(MBM):类比 BERT 的 MLM 任务,随机掩码 BURST 中的部分字节,要求模型根据上下文预测原始值。**Same-origin BURST Prediction **(SBP):判断两个 BURST 是否源自同一应用会话,建模跨 BURST 的语义一致性。2 相关工作2.1 加密流量分类指纹构建方法。与明文流量下依赖深度包检测(DPI)的方法不同,当流量被加密后,传统基于载荷关键词的识别手段失效。为此,部分研究转向利用协议中未加密的字段信息构建应用指纹。例如,FlowPrint [35] 从流量中提取设备标识、证书信息、数据包大小及时序特征,通过聚类与交叉关联构建指纹库,实现高效分类。然而,此类指纹在虚拟化通信网络(如容器、云环境)中极易被篡改或失真,导致语义失效。相比之下,本文提出的 ET-BERT完全不依赖任何明文信息,从根本上规避了该脆弱性。[35] Thijs van Ede, Riccardo Bortolameotti, Andrea Continella, Jingjing Ren, Daniel J. Dubois, Martina Lindorfer, David R. Choffnes, Maarten van Steen, and Andreas Peter. 2020. FlowPrint: Semi-Supervised Mobile-App Fingerprinting on Encrypted Network Traffic. InAnnual Network and Distributed System Security Symposium.统计特征方法。多数加密流量分类研究试图通过挖掘流量的统计特性来绕过加密限制。AppScanner [34] 利用数据包大小的统计分布训练随机森林分类器;BIND [1] 则聚焦于时序间隔等时间维度特征。然而,随着互联网应用与网站架构日益复杂,人工设计通用性强、鲁棒性高的统计特征变得极为困难。而 ET-BERT 无需依赖专家特征工程,能够从原始字节序列中自动学习判别性表示。[34] Vincent F. Taylor, Riccardo Spolaor, Mauro Conti, and Ivan Martinovic. 2018. Robust Smartphone App Identification via Encrypted Network Traffic Analysis.IEEE Transactions on Information Forensics and Security13, 1 (2018), 63–78.[1] Khaled Al-Naami, Swarup Chandra, Ahmad M. Mustafa, Latifur Khan, Zhiqiang Lin, Kevin W. Hamlen, and Bhavani M. Thuraisingham. 2016. Adaptive Encrypted Traffic Fingerprinting with Bi-Directional Dependence. Inthe Annual Conference on Computer Security Applications. 177–188.深度学习模型。近年来,基于监督学习的深度神经网络因其自动特征提取能力,成为加密流量分类的主流范式。DF [33] 采用卷积神经网络(CNN)处理加密流量的包长序列;FS-Net [20] 则使用循环神经网络(RNN)建模时序依赖;Deeppacket [23] 与 TSCRNN [19] 进一步尝试直接从原始载荷字节中学习特征。尽管性能显著优于传统方法,但这类模型高度依赖大规模标注数据,在类别不平衡或标注稀缺场景下易学习到有偏表示。而 ET-BERT 通过预训练机制,仅需少量标注样本即可实现高性能微调,有效缓解数据依赖问题。[33] Payap Sirinam, Mohsen Imani, Marc Juarez, and Matthew Wright. 2018. Deep Fingerprinting: Undermining Website Fingerprinting Defenses with Deep Learning. Inthe ACM SIGSAC Conference on Computer and Communications Security. 1928–1943.[20] Chang Liu, Longtao He, Gang Xiong, Zigang Cao, and Zhen Li. 2019. FS-Net: A Flow Sequence Network For Encrypted Traffic Classification. InIEEE Conference on Computer Communications. 1171–1179.[23] Mohammad Lotfollahi, Mahdi Jafari Siavoshani, Ramin Shirali Hossein Zade, and Mohammdsadegh Saberian. 2020. Deep Packet: A Novel Approach for Encrypted Traffic Classification Using Deep Learning.Soft Computing24 (2020), 1999–2012.[19] Kunda Lin, Xiaolong Xu, and Honghao Gao. 2021. TSCRNN: A Novel Classification Scheme of Encrypted Traffic Based on Flow Spatiotemporal Features for Efficient Management of IIoT.Computer Networks190 (2021), 107974.2.2 预训练模型在自然语言处理(NLP)领域,基于 Transformer 的深度双向预训练模型已在多项任务上取得最优性能。在此基础上,RoBERTa [22] 引入动态掩码策略,ALBERT [16] 提出句子顺序预测任务,通过改进无监督预训练目标进一步提升模型能力。此外,预训练模型的扩展方向包括知识增强与模型压缩:ERNIE [40] 融入实体知识以增强语义理解;DistilBERT [28] 则通过知识蒸馏减少网络层数与参数量,在略微牺牲性能的前提下显著加速推理。更重要的是,预训练范式已成功拓展至跨模态(如视觉-语言)与计算机视觉等领域,充分证明其利用无标签数据学习鲁棒表示、并在小样本标注条件下实现高效迁移的普适优势。[22] Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, and Veselin Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach.arXiv preprint arXiv:1907.11692(2019).[16] Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel, Piyush Sharma, and Radu Soricut. 2020. ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. InInternational Conference on Learning Representations.[40] Zhengyan Zhang, Xu Han, Zhiyuan Liu, Xin Jiang, Maosong Sun, and Qun Liu. 2019. ERNIE: Enhanced Language Representation with Informative Entities. Inthe Conference of the Association for Computational Linguistics. 1441–1451.[28] Victor Sanh, Lysandre Debut, Julien Chaumond, and Thomas Wolf. 2019. DistilBERT, A Distilled Version of BERT: Smaller, Faster, Cheaper and Lighter.arXiv preprint arXiv:1910.01108(2019).在加密流量分类领域,尽管加密载荷看似无语义,Sengupta 等人 [29] 发现不同应用生成的密文在随机性上存在差异,表明加密流量并非完全随机,仍隐含可区分的模式。PERT [12] 首次将预训练思想引入该领域,通过迁移 ALBERT 模型,在 ISCX-VPN-Service 数据集上取得了 93.23% 的 F1 分数。然而,如本文第 4.2 节实证研究所示,PERT缺乏面向加密流量特性的输入表示设计与专用预训练任务,导致其在新型加密协议(如 TLS 1.3)上的泛化能力受限。[29] Satadal Sengupta, Niloy Ganguly, Pradipta De, and Sandip Chakraborty. 2019. Exploiting Diversity in Android TLS Implementations for Mobile App Traffic Classification. In The World Wide Web Conference. 1657–1668.[12] Hong Ye He, Zhi Guo Yang, and Xiang Ning Chen. 2020. PERT: Payload Encoding Representation from Transformer for Encrypted Traffic Classification. InITU Kaleidoscope: Industry-Driven Digital Transformation. 1–8.针对上述不足,本文提出两项面向网络流量结构特性的自监督预训练任务:充分考虑流量传输的突发性结构(BURST-level pattern);建模数据包载荷间的双向上下文关联(bi-directional association);并设计两种微调策略,使模型更契合下游分类任务的需求,从而显著提升泛化性能与适应性。3 ET-BERT 模型3.1 模型架构本文旨在学习通用的加密流量表示,并支持多种下游场景下的分类任务(如应用识别、加密协议区分或服务类型判定)。为此,我们提出一种两阶段预训练策略:预训练阶段:利用大规模无标签流量数据,学习通用的报文级(datagram-level)流量表示;微调阶段:在特定任务的小规模标注数据上调整模型参数,实现高精度分类。具体而言,在预训练阶段,模型以无标签流量流为输入,输出每个报文的上下文表示;在微调阶段,则以任务相关的标注包或流为输入,预测其类别标签。需指出的是,加密流量与自然语言或图像存在本质差异:其不包含人类可理解的语义内容,也缺乏显式的语义单元。为有效将预训练技术迁移至该领域,ET-BERT 引入三个核心组件(如图2所示):Datagram2Token 方法(第3.2节):将原始加密流量转换为保留模式结构的类词元(token-like)单元,适配预训练框架;两项自监督预训练任务(第3.3节):提出掩码 BURST 模型(Masked BURST Model, MBM)与同源 BURST 预测(Same-origin BURST Prediction, SBP),从传输上下文(而非语义上下文)中学习报文表示;两种微调策略(第3.4节):针对不同任务粒度,设计包级微调(packet-level)与流级微调(flow-level)机制。ET-BERT 的主干网络采用多层双向 Transformer 块 [36],每块包含多头自注意力机制,用于捕获报文中各编码单元间的隐式依赖关系。本文实现中,网络包含12 个 Transformer 块,每层自注意力头数为12,输入词元维度 ( H = 768 ),最大输入序列长度为512。[36] Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All You Need. In the International Conference on Neural Information Processing Systems. 6000–6010.3.2 Datagram2Token 流量表示在真实网络环境中,海量流量包含来自不同应用、协议或服务的异构流,难以直接学习稳定且具判别性的表示。为此,我们首先对原始抓包轨迹进行会话级切分:基于五元组(源IP:端口、目的IP:端口、协议)提取同一通信会话的完整流,确保每条流源自单一类别。为进一步将网络流转化为类似自然语言的词元序列,我们提出Datagram2Token 模块,包含以下三个步骤:BURST 生成器(BURST Generator):从单一会话流中提取连续的单向传输片段(客户端→服务器 或 服务器→客户端),称为BURST[26, 31],用以表征会话的部分完整信息;BURST 到词元转换(BURST2Token):通过二元组(bi-gram)模型将每个 BURST 中的十六进制字节序列映射为词元嵌入,并将其划分为两个子段,为预训练任务做准备;词元嵌入构造(Token2Embedding):将每个词元的词元嵌入(token embedding)、位置嵌入(position embedding)与段落嵌入(segmentaiton embedding)相加,形成最终的输入表示。[26] Andriy Panchenko, Lukas Niessen, Andreas Zinnen, and Thomas Engel. 2011. Website Fingerprinting in Onion Routing Based Anonymization Networks. Inthe Annual ACM Workshop on Privacy in the Electronic Society. 103–114.[31] Meng Shen, Jinpeng Zhang, Liehuang Zhu, Ke Xu, and Xiaojiang Du. 2021. Accurate Decentralized Application Identification via Encrypted Traffic Analysis Using Graph Neural Networks.IEEE Transactions on Information Forensics and Security16 (2021), 2367–2380.3.2.1 BURST 生成器BURST定义为:在单一会话流中,由一次请求或响应产生的、时间上连续的一组单向网络包。从应用层视角看,BURST 序列刻画了网络流的传输模式。现代 Web 服务普遍采用客户端渲染,将页面内容(如文本、图片)拆分为多个对象,形成多样化的文档对象模型(DOM)树。这种结构会隐式影响客户端的资源请求行为,使得每次资源加载对应一个语义完整的网络突发单元——即 BURST。我们以此作为预训练模型的输入单元。🔍为什么用 BURST?现代 Web 服务采用客户端渲染(Client-side Rendering),页面 DOM 树被拆分为文本、图片等独立对象,导致资源请求呈现语义分段性。每个 DOM 片段触发一次网络突发(BURST),天然形成语义感知的流量单元。给定一个抓包文件中的轨迹Trace={ flowi∣i∈N+}, \text{Trace} = \{ \text{flow}_i \mid i \in \mathbb{N}^+ \},Trace={flowi​∣
返回列表