回到博客

AI

用于 EEG 的 Transformer:什么真正有效

对近期论文的实践性阅读:架构在哪些地方正确,归纳偏置在何处仍然重要。

9 minTransformerEEG深度学习

为什么写这篇

几乎每周都有新论文把 Transformer 用在 EEG 上,多数在某一个基准上报出小幅提升。作为一名正在学习的学生,我需要一种方法来阅读这些论文,而不是被它们裹挟。

通常有帮助的做法

  • 基于 patch 的分词优于原始采样点——对 500 Hz 序列做注意力是浪费。
  • 通道感知的注意力。 EEG 通道并非可互换,忽视拓扑等于扔掉结构。
  • 在无标签记录上的自监督预训练,当下游标签预算很小时。

归纳偏置仍然占优之处

在被试受限的数据集上,前端加一个小的卷积模块,通常能追平甚至超越纯 Transformer。对局部时序结构的偏好是真实的物理规律,不是需要克服的限制。

# 我反复回到的前端草图
x = TemporalConv(kernel=25)(x)   # 局部时序特征
x = SpatialConv(channels=64)(x)  # 学习空间滤波器组
x = Transformer(depth=4)(x)      # 顶层的长程上下文

诚实的对照

我在每次实验里都保留一个浅层 ConvNet 基线。如果 Transformer 在相同预处理与训练预算下无法明显胜出,那这个结果就还不算数。

相关阅读