科研快讯 | Brain2Qwerty:非侵入式脑机接口用AI将脑活动转为文字
本研究由美国Meta AI(FAIR实验室) 、法国巴黎文理研究大学(PSL) 以及阿道夫·罗斯柴尔德基金会医院的研究人员联合完成。这是一次典型的跨学科、跨国协作——将前沿AI技术与临床神经科学深度融合,为非侵入式脑机接口开辟了全新范式。

研究背景:为什么需要非侵入式脑机接口?
脑机接口(Brain-Computer Interface, BCI)被视为帮助运动障碍患者恢复沟通能力的核心技术路径。中风、肌萎缩侧索硬化症(ALS)、脑外伤等神经系统疾病可导致患者暂时或永久丧失运动功能,无法通过语言、键盘或电子设备与外界交流。
目前性能较好的脑机接口系统大多依赖植入式传感器——需要通过手术将电极置于大脑表面或内部。尽管这类系统能够实现较高的解码精度,但手术本身存在感染、组织损伤等风险,严重限制了其在更广泛患者群体中的应用。
核心矛盾:侵入式方法精度高但风险大,非侵入式方法安全但信号质量差、解码精度低。
Brain2Qwerty的诞生,正是瞄准了这一核心矛盾——能否在不动手术的前提下,实现接近侵入式水平的文字解码?
技术架构:CNN + Transformer + 预训练语言模型
Brain2Qwerty是一个端到端的深度学习模型,其架构设计体现了当前神经信号解码领域的前沿思路:
1️⃣ 卷积编码模块(CNN/Conformer)
模型的前端采用卷积神经网络处理原始脑电信号。该模块负责从连续的脑电/脑磁时间序列中提取空间-时间特征模式——具体而言,是捕获与手指按键动作相关的运动皮层活动特征。
2️⃣ Transformer解码器
中间层使用Transformer架构进行序列到序列的转换。Transformer的自注意力机制使其能够捕捉脑活动信号中的长程依赖关系,将编码后的神经特征映射为字符级别的预测。
3️⃣ 预训练语言模型
最后,模型接入一个经过微调的预训练大语言模型(LLM),利用语言的上下文信息对字符预测进行校正和优化。这一步至关重要:当神经信号嘈杂时,语言模型可以根据语义连贯性"脑补"出最可能的完整句子。
这三层架构的联合训练,使Brain2Qwerty能够从原始脑电信号直接输出可读文本,无需人工设计的中间特征。

实验设计:35名参与者的双模态验证
研究团队设计了严谨的实验方案:
- 参与者:35名健康志愿者
- 任务范式:句子逐字显示在屏幕上,参与者阅读并记忆后,在视觉提示引导下凭记忆在键盘上输入该句子,无视觉反馈
- 信号采集:同时使用两种非侵入式脑信号采集方式——
- 脑电图(EEG) :测量头皮表面的电活动信号
- 脑磁图(MEG) :检测神经元活动产生的磁场
- 核心挑战:模型需要仅凭大脑信号,预测参与者正在输入的字符序列
这一实验设计的巧妙之处在于,它模拟了真实场景中的"脑到文本"通路——不是简单地识别预定义的指令,而是从连续脑信号中解码自由生成的自然语言句子。

核心结果:MEG远优于EEG,最佳参与者错误率仅18%
实验结果呈现了清晰的梯度:
| 信号类型 | 平均字符错误率(CER) | 最佳参与者CER |
|---|---|---|
| MEG(脑磁图) | 29% | 18% |
| EEG(脑电图) | 65% | — |
关键发现:
📊 MEG的显著优势:脑磁图信号的空间分辨率和时间精度均优于脑电图,这使得Brain2Qwerty在MEG数据上实现了远低于EEG的错误率。29%的平均字符错误率意味着系统能正确还原约七成的字符。
🏆 个体差异显著:表现最佳的参与者在MEG条件下错误率降至18%,即超过80%的字符被正确解码。这一数字已经接近实用水平——对于日常沟通场景,配合语言模型的后处理,可以理解大部分内容。
✨ 泛化能力:模型能够准确识别未出现在训练集中的句子,表明Brain2Qwerty学到的不仅是记忆训练数据中的特定句子,而是真正理解了脑活动与字符输入之间的映射关系。
⚠️ EEG仍有差距:虽然EEG设备的便携性和成本优势远超MEG,但65%的平均错误率表明,在当前技术条件下,EEG信号的质量仍难以支撑高精度的文字解码。这也是未来技术攻关的重点方向。
从v1到v2:迭代带来的飞跃
值得一提的是,Brain2Qwerty项目已发展至第二代(v2)。与v1相比,v2在以下方面实现了显著提升:
- 数据规模:v2为每位参与者录制约10小时的脑磁图数据,共采集约22,000个训练句子,是v1的十倍以上
- 语言模型升级:采用微调的大语言模型替代v1中的n-gram语言模型,显著提升了句子级别的重建质量
- 端到端优化:CTC分词器、对比对齐和LLM三阶段联合训练,实现了更优的端到端解码
v2的报告显示,最佳参与者达到了78%的单词准确率,超过一半的解码句子仅含一个或零个单词错误。
与侵入式系统的对比
为了理解Brain2Qwerty的意义,有必要将其与侵入式脑机接口进行对比:
| 维度 | Brain2Qwerty(非侵入式) | 侵入式BCI(如Neuralink) |
|---|---|---|
| 是否需要手术 | ❌ 不需要 | ✅ 需要 |
| 信号质量 | 中等(MEG)/ 较低(EEG) | 高 |
| 最佳单词错误率 | ~22%(v2, MEG) | <2% |
| 设备便携性 | 低(MEG需屏蔽室) | 中(植入后可移动) |
| 安全性 | 高 | 存在手术风险 |
| 适用人群范围 | 广泛 | 受限于手术适应症 |
差距是明显的——侵入式系统在精度上仍有压倒性优势。但Brain2Qwerty的价值在于:它证明了非侵入式路径的可行性天花板远高于此前的认知。此前非侵入式方法的单词准确率上限约为8%,而Brain2Qwerty v2将其提升至61%——提升了近8倍。
未来展望:从"打字解码"到"想象打字"
研究团队指出了两个关键的下一步方向:
1. 从实际键盘输入到想象打字
当前系统要求参与者实际在键盘上执行打字动作,模型解码的是与运动执行相关的脑信号。下一步的目标是仅凭想象打字——无需任何实际的肢体动作,直接从运动意图的脑信号中解码文本。
这对于完全瘫痪的患者而言至关重要:他们既无法移动手指,也无法发出语音,但如果大脑仍能产生打字意图的神经信号,Brain2Qwerty的框架就有望为他们打开一扇沟通之窗。
2. 拓展到更广泛的设备控制
除了文字生成,这一技术框架未来还可拓展到控制假肢、轮椅、智能家居等外部设备。其核心逻辑是一致的:将特定意图的脑活动模式解码为控制指令。
3. 硬件小型化
当前MEG设备体积庞大、价格昂贵,且需要在磁屏蔽室内使用,离临床应用尚有距离。研究团队关注到光泵磁力计(OPM) 技术的发展——这种新型传感器有望使MEG设备走向便携化,从而大幅降低应用门槛。

局限性与挑战
客观来看,Brain2Qwerty目前仍面临以下局限:
- 参与者为健康志愿者:尚未在真正的运动障碍患者群体中验证,临床转化需要额外的验证研究
- MEG硬件限制:当前MEG系统是大型实验室设备,短期内无法进入日常临床或家庭场景
- EEG精度不足:虽然EEG设备更易获取,但65%的错误率离实用还有相当距离
- 语言局限性:现有实验主要基于特定语言的句子,跨语言泛化能力有待验证
- 长时间稳定性:系统在不同时间段、不同疲劳状态下的表现稳定性尚需评估
学术意义与行业影响
Brain2Qwerty代表了非侵入式脑机接口领域的一个重要里程碑,其意义在于:
🔬 科学层面:证明了深度学习+大语言模型的组合架构可以有效解码非侵入式脑信号中的语义信息,为后续研究提供了新的技术范式。
🏥 临床层面:为运动障碍患者提供了一种无需手术即可获得沟通辅助的技术路径,尽管距离临床应用仍需时日,但方向已经明确。
🔓 开放科学层面:Meta团队公开了训练代码和数据集,并承诺投入500万美元建设"数字大脑计划"(Digital Brain Project),推动开放神经科学数据集的建设。这种开放态度有助于加速整个领域的进步。

更多推荐
所有评论(0)