尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

脑电大模型——第二篇:BIOT(Biosignal Transformer)

脑电大模型——第二篇:BIOT(Biosignal Transformer) 论文基本信息Paper:BIOT: Cross-data Biosignal Learning in the WildInstitution:University of Illinois Urbana-ChampaignPublication:arXiv preprintYear:2023Code:Open Source Code1 摘要论文针对生物信号如EEG、ECG数据格式多样、通道不匹配、采样长度不一、缺失值普遍的痛点提出名为BIOT的通用生物信号编码框架。该模型通过创新的分通道token化策略将异构生物信号统一转化为“生物信号句子”结构结合线性Transformer实现跨格式、跨数据集的联合学习与知识迁移。实验在EEG癫痫检测、癫痫分型、脑电异常检测、ECG心律失常分型、人体活动识别等多个任务的结果显示原生BIOT在多数任务上优于现有强基线模型如CHB-MIT癫痫检测平衡准确率提升约3%基于多源数据预训练的BIOT模型可进一步带来最高4%的性能增益证明了“生物信号基础模型预训练微调”范式的可行性。2 背景脑电、心电等生物信号是临床诊断、健康监测的核心数据现有深度学习模型大多针对特定数据集、特定任务设计输入格式固定泛化能力受限。但真实临床场景中不同设备、不同采集方案会带来三大核心挑战通道不匹配不同数据集的电极导联数量、位置存在差异长度不统一样本时长、采样率各不相同缺失值普遍设备故障、信号伪影会导致通道缺失或片段缺失。传统方法通过截断/补全对齐长度、插补补齐缺失通道会引入额外噪声并造成数据分布偏移损害模型泛化性。受视觉ViT、AST以及大语言模型的启发论文探索能适配多格式输入的生物信号统一编码模型支持跨数据源的联合预训练与下游微调推动生物信号领域基础模型的发展。3 贡献与图像、音频或自然语言相比生理电信号更复杂主要原因是它有多个通道。将形式多样的生理电信号转换成统一的“句子”结构并非易事。本文提出了BIOT来解决这个问题它通过一个新颖的生物信号分词tokenization模块将每个通道单独分割成词元token并展平flatten形成一致的生物信号“句子”。主要贡献如下提出通用生物信号 Transformer 架构 BIOT首次实现了对不同通道数、不同时长、存在缺失值的异构生物信号的统一编码无需强制对齐输入格式。验证跨数据知识迁移能力支持多源无标注数据联合无监督预训练、跨任务监督预训练证明了生物信号领域 “预训练 - 微调” 范式的有效性为生物信号大模型研究提供了可行路径。多场景下的优异实证性能在 EEG、ECG、人体活动感知三大类信号、共 9 个数据集上完成全面评测标准监督、缺失数据、跨数据迁移等场景下均优于强基线模型。4 方法4.1 数据集论文中一共用到了9组数据集其中共3组大规模数据用于无监督预训练共6组数据集用于下游任务评测覆盖脑电、心电、可穿戴信号三类数据集的具体可见表1。表1 数据集统计数据集信号类型记录数采样率通道数时长样本量任务SHHS睡眠EEG5445125HzC3‑A2C4‑A130s5093522无监督预训练PREST静息EEG6478200Hz16导联10s5110992无监督预训练CardiologyECG21264500Hz6/12导联ECG10s495970无监督预训练CHB‑MIT癫痫EEG686256Hz16导联10s326993二分类癫痫/非癫痫IIIC Seizure癫痫EEG2702200Hz16导联10s165309多分类6种癫痫模式TUAB临床EEG2339256Hz16导联10s409455二分类正常 / 异常TUEV临床EEG11914256Hz16导联5s112491多分类6种脑电事件PTB‑XLECG21911500Hz12导联ECG5s65511二分类心律失常表型HARWearable sensors1029950Hz9轴2.56s10299多分类6种人体动作4.2 预处理前3个数据集SHHS、PREST、Cardiology完全用于无监督预训练。接下来的4个数据集CHB‑MIT 、IIIC Seizure 、TUAB、TUEV用于监督学习使用国际10-20系统中常见的16个双极通道“FP1-F7”“F7-T7”“T7-P7”“P7-O1”“FP2-F8”“F8-T8”“T8-P8”“P8-O2”“FP1-F3”“F3-C3”“C3-P3”“P3-O1”“FP2-F4”“F4-C4”“C4-P4”“P4-O2”。对于CHB-MIT包含23例患者首先使用患者1至19进行训练20和21用于验证22和23用于测试之后翻转验证集和测试集再次进行实验。对于IIIC Seizure将患者组按60%:20%:20%分为训练集/验证集/测试集。对于TUAB和TUEV训练和测试分别由数据集提供并且进一步将训练患者按80%:20%分为训练组和验证组。对于PTB-XL将患者组按照80%:10%:10%的比例分为训练集/验证集/测试集。HAR的训练集和测试集已经提供了并进一步将测试患者按50%:50%划分为验证/测试。主要的数据预处理步骤可以分为两步1.重采样通过线性插值将所有数据统一到目标采样率EEG统一为200HzECG统一为500HzHAR统一为50Hz依据奈奎斯特采样定理选取保证信号有效信息不丢失。2.归一化每个通道独立使用其绝对幅值的95%分位数进行归一化缓解不同通道、不同数据集间的单位与幅度差异。数学上可以理解为对于每个多通道的生物信号S ∈ R I × J \mathbf{S} \in \mathbb{R}^{I \times J}S∈RI×J在其每个通道S [ i ] \mathbf{S}[i]S[i]上做S [ i ] percentile ( ∣ S [ i ] ∣ , 95 % ) \frac{\mathbf{S}[i]}{\text{percentile}(|\mathbf{S}[i]|,95\%)}percentile(∣S[i]∣,95%)S[i]​归一化操作。4.3 模型架构如图1所示BIOT编码器级联了两个模块1.生物信号Tokenization模块将任意生物信号分词为一个“句子”结构这种设计可以潜在地使先前的语言建模技术为当前的生物信号模型赋能。2.线性Transformer模块用于捕获“句子”内部复杂的词元交互同时保持线性复杂度。图1 BIOT模型4.3.1 模块1生物信号Tokenization该模块的核心思路是“分通道切片展平成句”从根源上解决通道不匹配、长度可变、缺失值问题具体可见图2展示的两个样本。样本1有4个通道Fp1、Fp2、O1、O2持续5秒模型将每个通道分词成段segment然后用三个嵌入embedding参数化20个段通道嵌入中用不同的颜色表示通道蓝色-Fp1、棕色-Fp2、绿色-O1、黄色-O2)。样本2有通道不匹配无O2长度可变Fp1和Fp2较短和缺失值在O1中问题使用BIOT仍然可以分词成一个可比较的“句子”。图2 生物信号表征模块1主要可以分为五部分其中的重采样和归一化已经在4.2 预处理中做了详细说明接下来主要来分析分通道切片、展平成句、三重嵌入融合。分通道切片对每个通道独立进行切片切分为时长为t tt的token相邻token间可设置p pp秒的重叠若信号存在缺失片段直接丢弃对应token无需插补。展平成句将所有通道的token按顺序展平形成长度可变的“生物信号句子”。三重嵌入融合为每个token融合三类嵌入信息。–片段嵌入对token做快速傅里叶变换FFT提取全频带能量特征经全连接网络映射为向量捕捉频域特征–通道嵌入可学习的通道嵌入表为不同导联添加空间标识–位置嵌入采用正弦余弦相对位置编码保留时序先后信息无需额外学习参数。4.3.2 模块2线性Transformer由于多通道生物信号切片后 token 数量多原生 Transformer 的二次复杂度难以承受因此采用线性注意力机制将时空复杂度从O ( N 2 ) O(N^2)O(N2)降为线性O ( N ) O(N)O(N)适配长序列生物信号。在形式上假设W K , W V , W Q ∈ R l × k \mathrm{W}^K,\mathrm{W}^V,\mathrm{W}^Q\in\mathbb{R}^{l\times k}WK,WV,WQ∈Rl×k是K KK矩阵V VV矩阵和Q QQ矩阵自注意力模块使用降秩参数矩阵E ⊤ ∈ R N × d \mathbf{E}^{\top}\in\mathbb{R}^{N\times d}E⊤∈RN×dF ∈ R d × N \mathbf{F}\in\mathbb{R}^{d\times N}F∈Rd×N对softmax注意力N × N N\times NN×N进行rank-d近似输出H ∈ R N × k \mathbf{H}\in\mathbb{R}^{N\times k}H∈RN×k为H A t t e n t i o n ( X W Q , E X W K , F X W V ) s o f t m a x ( ( X W Q ) ( E X W K ) ⊤ k ) ⏟ N × d ⋅ F X W V ⏟ d × l \begin{aligned} \mathbf{H} \mathrm{Attention}(\mathbf{X}\mathbf{W}^{Q},\mathbf{E}\mathbf{X}\mathbf{W}^{K},\mathbf{F}\mathbf{X}\mathbf{W}^{V}) \\ \underbrace{\mathrm{softmax}\left(\frac{(\mathbf{X}\mathbf{W}^Q)(\mathbf{E}\mathbf{X}\mathbf{W}^K)^\top}{\sqrt{k}}\right)}_{N\times d}\cdot\underbrace{\mathrm{F}\mathbf{X}\mathbf{W}^V}_{d\times l} \end{aligned}H​Attention(XWQ,EXWK,FXWV)N×dsoftmax(k​(XWQ)(EXWK)⊤​)​​⋅d×lFXWV​​​模块2的具体架构可见图1的右上部分主要特点如下基础结构线性自注意力层全连接前馈网络每层前加入层归一化层间加入残差连接与 Dropout保证训练稳定与收敛速度。输出聚合对所有token的输出做均值池化得到整个生物信号样本的全局嵌入表示实验验证均值池化效果略优于添加分类token。4.4 训练与应用场景BIOT编码器可以应用于各种真实世界的生物信号如图1所示主要包括标准监督学习完整格式数据下的分类任务编码器后接ELU指数线性单元激活层与线性分类头端到端训练。缺失数据监督学习存在通道缺失、片段缺失的场景下模型结构无需修改直接适配“标准监督学习”的输入。无监督预训练在多源无标注数据上联合预训练采用对比学习目标随机丢弃部分通道与 token 生成扰动信号通过扰动信号的嵌入预测原信号的嵌入使用InfoNCE对比损失优化。具体步骤如下– 对原始生物信号S \mathbf{S}S随机丢弃部分信道和从剩余信道中丢弃部分段从而形成扰动信号S ~ \tilde{\mathbf{S}}S~。– 通过相同的BIOT编码器获得S \mathbf{S}S和S ~ \tilde{\mathbf{S}}S~的嵌入并在扰动信号嵌入后增加一个预测器例如两层神经网络最终获得的Z \mathbf{Z}Z和Z ~ \tilde{\mathbf{Z}}Z~分别是真实嵌入和预测嵌入Z B I O T ( S ) , Z ~ p r e d i c t o r ( B I O T ( S ~ ) ) \mathbf{Z}\mathrm{~BIOT}(\mathbf{S}),\tilde{\mathbf{Z}}\mathrm{~predictor}(\mathrm{BIOT}(\tilde{\mathbf{S}}))ZBIOT(S),Z~predictor(BIOT(S~))– 对Z \mathbf{Z}Z和Z ~ \tilde{\mathbf{Z}}Z~进行了样本L2正则化后使用交叉熵损失作为对比损失进行优化L CrossEntropyLoss ( s o f t m a x ( ⟨ Z , Z ~ ⊤ ⟩ / T ) , I ) \mathcal{L}\text{ CrossEntropyLoss}\left(\mathrm{softmax}\left(\langle\mathbf{Z},\tilde{\mathbf{Z}}^{\top}\rangle/T\right),\mathbf{I}\right)LCrossEntropyLoss(softmax(⟨Z,Z~⊤⟩/T),I)有监督预训练在一个标注任务上完成监督训练再移除分类头、添加新分类头迁移到格式不同的新任务上微调实现跨任务知识迁移。5 结果5.1 标准监督学习在多数下游任务上原生vanillaBIOT性能优于SPaRCNet、ContraWR、CNN-Transformer等强基线EEG任务CHB-MIT癫痫检测平衡准确率达0.6640比最优基线提升约3%IIIC癫痫分型、TUAB异常检测、TUEV事件分类均取得领先或相当水平。ECG与可穿戴任务PTB-XL心律失常检测、HAR人体动作识别上BIOT同样超越基线其中HAR任务提升显著。基于多源数据预训练的BIOT模型能进一步提升性能例如6个EEG数据集联合预训练的模型在CHB-MIT上平衡准确率可达 0.7068。5.2 缺失数据监督学习在 TUEV 数据集上模拟“片段缺失、通道缺失、两者同时缺失” 三种场景结果如图3所示图3 缺失通道或片段的监督学习所有模型性能随缺失程度提升而下降但BIOT及预训练BIOT的性能衰减幅度显著小于基线模型鲁棒性更强。通道缺失对性能的负面影响大于片段缺失符合“片段缺失仍保留全通道空间信息”的直觉。5.3 无监督预训练EEG方向基于PREST、PRESTSHHS的无监督预训练模型微调后在4个EEG下游任务上均获得稳定增益多数据集联合预训练效果优于单数据集预训练。ECG方向基于Cardiology数据集的无监督预训练模型在PTB-XL下游任务上同样带来性能提升12导联预训练效果优于6导联。5.4 有监督预训练在不同格式的EEG任务间进行“监督预训练微调”实验结果如图4、图5所示图4 从不同的监督预训练模型上对TUEV进行微调图5 从不同的监督预训练模型上对CHB-MIT进行微调任务相关性决定迁移增益癫痫相关任务IIIC→CHB-MIT、同来源数据集TUAB→TUEV的迁移效果更显著。长时数据优于格式对齐尽管预训练数据格式与目标任务越接近越有利但更长时长的预训练数据能编码更丰富的时序信息迁移效果普遍更优。部分场景下监督预训练的效果优于无监督预训练。5.5 全量数据联合预训练将无监督数据PRESTSHHS与4个有监督EEG数据集CHB-MIT、IIIC Seizure、TUAB、TUEV结合训练得到的联合预训练模型在下游任务上普遍优于单独的无监督或监督预训练模型达到整体最佳效果。5.6 消融实验图6 目标采样率$r$的消融实验结果图7 Token时长$t$的消融实验结果图8 重叠时长$p$的消融实验结果针对三个核心超参数目标采样率r rr、Token时长t tt、重叠时长p pp的结论具体结果如图6、图7、图8目标采样率r rr高采样率保留更多高频细节对癫痫分型等精细任务增益明显对脑电异常检测等粗粒度任务影响较小需根据任务特性选取。Token时长t tttoken过长会导致句子总长度变短Transformer建模能力下降性能衰减1秒左右的 token 长度综合效果最优。重叠时长p pp更大的重叠会增加序列长度同时保留更多时序过渡信息模型性能有小幅提升。6 总结BIOT是生物信号跨数据学习的里程碑式工作突破了传统模型对固定输入格式的强依赖首次实现了对异构生物信号的统一Transformer建模并且首次提出了脑电大模型EEG Foundation Model的概念。其“分通道token化线性Transformer”的设计为脑电乃至全品类生物信号的基础模型研究提供了核心技术框架。论文通过多场景、多数据集的充分实验系统验证了该架构在标准监督、缺失鲁棒、跨数据迁移等场景下的有效性证明了“大规模预训练下游微调”范式在生物信号领域的巨大潜力对后续脑电大模型、临床AI落地都具有重要的参考与奠基意义。
返回列表