本研究由美国Meta AI(FAIR实验室) 、法国巴黎文理研究大学(PSL) 以及阿道夫·罗斯柴尔德基金会医院的研究人员联合完成。这是一次典型的跨学科、跨国协作——将前沿AI技术与临床神经科学深度融合,为非侵入式脑机接口开辟了全新范式。

研究背景:为什么需要非侵入式脑机接口?

脑机接口(Brain-Computer Interface, BCI)被视为帮助运动障碍患者恢复沟通能力的核心技术路径。中风、肌萎缩侧索硬化症(ALS)、脑外伤等神经系统疾病可导致患者暂时或永久丧失运动功能,无法通过语言、键盘或电子设备与外界交流。

目前性能较好的脑机接口系统大多依赖植入式传感器——需要通过手术将电极置于大脑表面或内部。尽管这类系统能够实现较高的解码精度,但手术本身存在感染、组织损伤等风险,严重限制了其在更广泛患者群体中的应用。

核心矛盾:侵入式方法精度高但风险大,非侵入式方法安全但信号质量差、解码精度低。

Brain2Qwerty的诞生,正是瞄准了这一核心矛盾——能否在不动手术的前提下,实现接近侵入式水平的文字解码?

技术架构:CNN + Transformer + 预训练语言模型

Brain2Qwerty是一个端到端的深度学习模型,其架构设计体现了当前神经信号解码领域的前沿思路:

1️⃣ 卷积编码模块(CNN/Conformer)

模型的前端采用卷积神经网络处理原始脑电信号。该模块负责从连续的脑电/脑磁时间序列中提取空间-时间特征模式——具体而言,是捕获与手指按键动作相关的运动皮层活动特征。

2️⃣ Transformer解码器

中间层使用Transformer架构进行序列到序列的转换。Transformer的自注意力机制使其能够捕捉脑活动信号中的长程依赖关系,将编码后的神经特征映射为字符级别的预测。

3️⃣ 预训练语言模型

最后,模型接入一个经过微调的预训练大语言模型(LLM),利用语言的上下文信息对字符预测进行校正和优化。这一步至关重要:当神经信号嘈杂时,语言模型可以根据语义连贯性"脑补"出最可能的完整句子。

这三层架构的联合训练,使Brain2Qwerty能够从原始脑电信号直接输出可读文本,无需人工设计的中间特征。

实验设计:35名参与者的双模态验证

研究团队设计了严谨的实验方案:

  • 参与者:35名健康志愿者
  • 任务范式:句子逐字显示在屏幕上,参与者阅读并记忆后,在视觉提示引导下凭记忆在键盘上输入该句子,无视觉反馈
  • 信号采集:同时使用两种非侵入式脑信号采集方式——
    • 脑电图(EEG) :测量头皮表面的电活动信号
    • 脑磁图(MEG) :检测神经元活动产生的磁场
  • 核心挑战:模型需要仅凭大脑信号,预测参与者正在输入的字符序列

这一实验设计的巧妙之处在于,它模拟了真实场景中的"脑到文本"通路——不是简单地识别预定义的指令,而是从连续脑信号中解码自由生成的自然语言句子。

核心结果:MEG远优于EEG,最佳参与者错误率仅18%

实验结果呈现了清晰的梯度:

信号类型平均字符错误率(CER)最佳参与者CER
MEG(脑磁图)29%18%
EEG(脑电图)65%

关键发现:

📊 MEG的显著优势:脑磁图信号的空间分辨率和时间精度均优于脑电图,这使得Brain2Qwerty在MEG数据上实现了远低于EEG的错误率。29%的平均字符错误率意味着系统能正确还原约七成的字符。

🏆 个体差异显著:表现最佳的参与者在MEG条件下错误率降至18%,即超过80%的字符被正确解码。这一数字已经接近实用水平——对于日常沟通场景,配合语言模型的后处理,可以理解大部分内容。

✨ 泛化能力:模型能够准确识别未出现在训练集中的句子,表明Brain2Qwerty学到的不仅是记忆训练数据中的特定句子,而是真正理解了脑活动与字符输入之间的映射关系。

⚠️ EEG仍有差距:虽然EEG设备的便携性和成本优势远超MEG,但65%的平均错误率表明,在当前技术条件下,EEG信号的质量仍难以支撑高精度的文字解码。这也是未来技术攻关的重点方向。

从v1到v2:迭代带来的飞跃

值得一提的是,Brain2Qwerty项目已发展至第二代(v2)。与v1相比,v2在以下方面实现了显著提升:

  • 数据规模:v2为每位参与者录制约10小时的脑磁图数据,共采集约22,000个训练句子,是v1的十倍以上
  • 语言模型升级:采用微调的大语言模型替代v1中的n-gram语言模型,显著提升了句子级别的重建质量
  • 端到端优化:CTC分词器、对比对齐和LLM三阶段联合训练,实现了更优的端到端解码

v2的报告显示,最佳参与者达到了78%的单词准确率,超过一半的解码句子仅含一个或零个单词错误。

与侵入式系统的对比

为了理解Brain2Qwerty的意义,有必要将其与侵入式脑机接口进行对比:

维度Brain2Qwerty(非侵入式)侵入式BCI(如Neuralink)
是否需要手术❌ 不需要✅ 需要
信号质量中等(MEG)/ 较低(EEG)
最佳单词错误率~22%(v2, MEG)<2%
设备便携性低(MEG需屏蔽室)中(植入后可移动)
安全性存在手术风险
适用人群范围广泛受限于手术适应症

差距是明显的——侵入式系统在精度上仍有压倒性优势。但Brain2Qwerty的价值在于:它证明了非侵入式路径的可行性天花板远高于此前的认知。此前非侵入式方法的单词准确率上限约为8%,而Brain2Qwerty v2将其提升至61%——提升了近8倍。

未来展望:从"打字解码"到"想象打字"

研究团队指出了两个关键的下一步方向:

1. 从实际键盘输入到想象打字

当前系统要求参与者实际在键盘上执行打字动作,模型解码的是与运动执行相关的脑信号。下一步的目标是仅凭想象打字——无需任何实际的肢体动作,直接从运动意图的脑信号中解码文本。

这对于完全瘫痪的患者而言至关重要:他们既无法移动手指,也无法发出语音,但如果大脑仍能产生打字意图的神经信号,Brain2Qwerty的框架就有望为他们打开一扇沟通之窗。

2. 拓展到更广泛的设备控制

除了文字生成,这一技术框架未来还可拓展到控制假肢、轮椅、智能家居等外部设备。其核心逻辑是一致的:将特定意图的脑活动模式解码为控制指令。

3. 硬件小型化

当前MEG设备体积庞大、价格昂贵,且需要在磁屏蔽室内使用,离临床应用尚有距离。研究团队关注到光泵磁力计(OPM) 技术的发展——这种新型传感器有望使MEG设备走向便携化,从而大幅降低应用门槛。

局限性与挑战

客观来看,Brain2Qwerty目前仍面临以下局限:

  1. 参与者为健康志愿者:尚未在真正的运动障碍患者群体中验证,临床转化需要额外的验证研究
  2. MEG硬件限制:当前MEG系统是大型实验室设备,短期内无法进入日常临床或家庭场景
  3. EEG精度不足:虽然EEG设备更易获取,但65%的错误率离实用还有相当距离
  4. 语言局限性:现有实验主要基于特定语言的句子,跨语言泛化能力有待验证
  5. 长时间稳定性:系统在不同时间段、不同疲劳状态下的表现稳定性尚需评估

学术意义与行业影响

Brain2Qwerty代表了非侵入式脑机接口领域的一个重要里程碑,其意义在于:

🔬 科学层面:证明了深度学习+大语言模型的组合架构可以有效解码非侵入式脑信号中的语义信息,为后续研究提供了新的技术范式。

🏥 临床层面:为运动障碍患者提供了一种无需手术即可获得沟通辅助的技术路径,尽管距离临床应用仍需时日,但方向已经明确。

🔓 开放科学层面:Meta团队公开了训练代码和数据集,并承诺投入500万美元建设"数字大脑计划"(Digital Brain Project),推动开放神经科学数据集的建设。这种开放态度有助于加速整个领域的进步。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐