AI
用于 EEG 的 Transformer:什么真正有效
对近期论文的实践性阅读:架构在哪些地方正确,归纳偏置在何处仍然重要。
9 minTransformerEEG深度学习
为什么写这篇
几乎每周都有新论文把 Transformer 用在 EEG 上,多数在某一个基准上报出小幅提升。作为一名正在学习的学生,我需要一种方法来阅读这些论文,而不是被它们裹挟。
通常有帮助的做法
- 基于 patch 的分词优于原始采样点——对 500 Hz 序列做注意力是浪费。
- 通道感知的注意力。 EEG 通道并非可互换,忽视拓扑等于扔掉结构。
- 在无标签记录上的自监督预训练,当下游标签预算很小时。
归纳偏置仍然占优之处
在被试受限的数据集上,前端加一个小的卷积模块,通常能追平甚至超越纯 Transformer。对局部时序结构的偏好是真实的物理规律,不是需要克服的限制。
# 我反复回到的前端草图
x = TemporalConv(kernel=25)(x) # 局部时序特征
x = SpatialConv(channels=64)(x) # 学习空间滤波器组
x = Transformer(depth=4)(x) # 顶层的长程上下文
诚实的对照
我在每次实验里都保留一个浅层 ConvNet 基线。如果 Transformer 在相同预处理与训练预算下无法明显胜出,那这个结果就还不算数。