近几年,图像生成领域取得了巨大的进步,尤其是文本到图像生成方面取得了重大突破:只要我们用文本描述自己的想法,AI 就能生成新奇又逼真的图像。
但其实我们可以更进一步 —— 将头脑中的想法转化为文本这一步可以省去,直接通过脑活动(如 EEG(脑电图)记录)来控制图像的生成创作。
这种「思维到图像」的生成方式有着广阔的应用前景。例如,它能极大提高艺术创作的效率,并帮助人们捕捉稍纵即逝的灵感;它也有可能将人们夜晚的梦境进行可视化;它甚至可能用于心理治疗,帮助自闭症儿童和语言障碍患者。
最近,来自清华大学深圳国际研究生院、腾讯 AI Lab 和鹏城实验室的研究者们联合发表了一篇「思维到图像」的研究论文,利用预训练的文本到图像模型(比如 Stable Diffusion)强大的生成能力,直接从脑电图信号生成了高质量的图像。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片论文地址:https://arxiv.org/pdf/2306.16934.pdf
项目地址:https://github.com/bbaaii/DreamDiffusion
近期一些相关研究(例如 MinD-Vis)尝试基于 fMRI(功能性磁共振成像信号)来重建视觉信息。他们已经证明了利用脑活动重建高质量结果的可行性。然而,这些方法与理想中使用脑信号进行快捷、高效的创作还差得太远,这主要有两点原因:
首先,fMRI 设备不便携,并且需要专业人员操作,因此捕捉 fMRI 信号很困难;
其次,fMRI 数据采集的成本较高,这在实际的艺术创作中会很大程度地阻碍该方法的使用。
相比之下,EEG 是一种无创、低成本的脑电活动记录方法,并且现在市面上已经有获得 EEG 信号的便携商用产品。
但实现「思维到图像」的生成还面临两个主要挑战:
1)EEG 信号通过非侵入式的方法来捕捉,因此它本质上是有噪声的。此外,EEG 数据有限,个体差异不容忽视。那么,如何从如此多的约束条件下的脑电信号中获得有效且稳健的语义表征呢?
2)由于使用了 CLIP 并在大量文本 - 图像对上进行训练,Stable Diffusion 中的文本和图像空间对齐良好。然而,EEG 信号具有其自身的特点,其空间与文本和图像大不相同。如何在有限且带有噪声的 EEG - 图像对上对齐 EEG、文本和图像空间?
为了解决第一个挑战,该研究提出,使用大量的 EEG 数据来训练 EEG 表征,而不是仅用罕见的 EEG 图像对。该研究采用掩码信号建模的方法,根据上下文线索预测缺失的 token。
不同于将输入视为二维图像并屏蔽空间信息的 MAE 和 MinD-Vis,该研究考虑了 EEG 信号的时间特性,并深入挖掘人类大脑时序变化背后的语义。该研究随机屏蔽了一部分 token,然后在时间域内重建这些被屏蔽的 token。通过这种方式,预训练的编码器能够对不同个体和不同脑活动的 EEG 数据进行深入理解。
对于第二个挑战,先前的解决方法通常直接对 Stable Diffusion 模型进行微调,使用少量噪声数据对进行训练。然而,仅通过最终的图像重构损失对 SD 进行端到端微调,很难学习到脑信号(例如 EEG 和 fMRI)与文本空间之间的准确对齐。因此,研究团队提出采用额外的 CLIP 监督,帮助实现 EEG、文本和图像空间的对齐。
具体而言,SD 本身使用 CLIP 的文本编码器来生成文本嵌入,这与之前阶段的掩码预训练 EEG 嵌入非常不同。利用 CLIP 的图像编码器提取丰富的图像嵌入,这些嵌入与 CLIP 的文本嵌入很好地对齐。然后,这些 CLIP 图像嵌入被用于进一步优化 EEG 嵌入表征。因此,经过改进的 EEG 特征嵌入可以与 CLIP 的图像和文本嵌入很好地对齐,并更适合于 SD 图像生成,从而提高生成图像的质量。
基于以上两个精心设计的方案,该研究提出了新方法 DreamDiffusion。DreamDiffusion 能够从脑电图(EEG)信号中生成高质量且逼真的图像。
图片
具体来说,DreamDiffusion 主要由三个部分组成:
1)掩码信号预训练,以实现有效和稳健的 EEG 编码器;
2)使用预训练的 Stable Diffusion 和有限的 EEG 图像对进行微调;
3)使用 CLIP 编码器,对齐 EEG、文本和图像空间。
首先,研究人员利用带有大量噪声的 EEG 数据,采用掩码信号建模,训练 EEG 编码器,提取上下文知识。然后,得到的 EEG 编码器通过交叉注意力机制被用来为 Stable Diffusion 提供条件特征。
图片
为了增强 EEG 特征与 Stable Diffusion 的兼容性,研究人员进一步通过在微调过程中减少 EEG 嵌入与 CLIP 图像嵌入之间的距离,进一步对齐了 EEG、文本和图像的嵌入空间。
与 Brain2Image 对比
研究人员将本文方法与 Brain2Image 进行比较。Brain2Image 采用传统的生成模型,即变分自编码器(VAE)和生成对抗网络(GAN),用于实现从 EEG 到图像的转换。然而,Brain2Image 仅提供了少数类别的结果,并没有提供参考实现。
鉴于此,该研究对 Brain2Image 论文中展示的几个类别(即飞机、南瓜灯和熊猫)进行了定性比较。为确保比较公平,研究人员采用了与 Brain2Image 论文中所述相同的评估策略,并在下图 5 中展示了不同方法生成的结果。
下图第一行展示了 Brain2Image 生成的结果,最后一行是研究人员提出的方法 DreamDiffusion 生成的。可以看到 DreamDiffusion 生成的图像质量明显高于 Brain2Image 生成的图像,这也验证了本文方法的有效性。
图片
消融实验
预训练的作用:为了证明大规模 EEG 数据预训练的有效性,该研究使用未经训练的编码器来训练多个模型进行验证。其中一个模型与完整模型相同,而另一个模型只有两层的 EEG 编码层,以避免数据过拟合。在训练过程中,这两个模型分别进行了有 / 无 CLIP 监督的训练,结果如表 1 中 Model 列的 1 到 4 所示。可以看到,没有经过预训练的模型准确性有所降低。
mask ratio:本文还
研究了用 EEG 数据确定 MSM 预训练的最佳掩码比。如表 1 中的 Model 列的 5 到 7 所示,过高或过低的掩码比会对模型性能都会产生不利影响。当掩码比为 0.75 达到最高的整体准确率。这一发现至关重要,因为这表明,与通常使用低掩码比的自然语言处理不同,在对 EEG 进行 MSM 时,高掩码比是一个较好的选择。
CLIP 对齐:该方法的关键之一是通过 CLIP 编码器将 EEG 表征与图像对齐。该研究进行实验验证了这种方法的有效性,结果如表 1 所示。可以观察到,当没有使用 CLIP 监督时,模型的性能明显下降。实际上,如图 6 右下角所示,即使在没有预训练的情况下,使用 CLIP 对齐 EEG 特征仍然可以得到合理的结果,这凸显了 CLIP 监督在该方法中的重要性。
图片
# ai
# Token
# github
# stable diffusion
# https
# 重构
# 掩码
# 所示
# 高质量
# 很好
# 并在
# 可以看到
# 自闭症
# 进行了
# 过程中
# 自己的
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
网络优化91478 】
【
技术知识72672 】
【
云计算0 】
【
GEO优化84317 】
【
优选文章0 】
【
营销推广36048 】
【
网络运营41350 】
【
案例网站102563 】
【
AI智能45237 】
相关推荐:
豆包 AI 辅助进行初级绘本创作的剧情构思
Replika AI:情感慰藉还是虚拟危机?深度剖析与用户反馈
教你用AI帮你生成一份详细的搬家清单,告别手忙脚乱
AI客服工具:24/7全天候支持业务增长的秘密武器
AI Agent:颠覆传统工作模式的关键力量
Midjourney怎样写风格化提示词_Midjourney风格提示词写法【教程】
教你用AI进行市场调研,快速生成消费者洞察报告
Microsoft Math Solver:AI数学解题神器深度评测
Claude怎么用新功能故事创作_Claude故事创作使用【方法】
怎么用AI帮你为初创公司进行市场定位分析?
AI音频增强和视频背景替换终极指南
AI电影制作:颠覆传统,引领未来*新纪元
5分钟教你用AI生成婚礼流程策划案,备婚新人必备
如何配置 DeepSeek 以支持企业级私有化部署
提升效率的AI工具:Jace、Yutori、Dia等效率神器测评
雷小兔ai智能写作如何优化语句_雷小兔ai智能写作语句润色技巧【攻略】
夸克AI能否查快递物流_夸克AI快递查询入口与单号输入【步骤】
宗教领袖影响力反思:警惕精神控制与信仰危机
批改网AI检测工具怎么生成评分报告_批改网AI检测工具报告生成与维度解读【指南】
11月电动两轮车线上销售排名出炉:九号份额达26.9%
Kaiber AI视频制作教程:轻松打造吸睛AI视频
通义千问怎么找新功能入口_通义千问新功能查找【攻略】
如何让ChatGPT模仿特定文风 创意写作与品牌话术生成教程
为什么你的简历过不了筛选?用AI帮你诊断并修复漏洞
百度AI助手官方入口 文心一言网页版登录入口
AI驱动合同管理:Microsoft Power Platform实战指南
Google Gemini 辅助进行 Android Studio 代码开发
Motion:革新项目管理的智能日历解决方案
2025最佳AI效率工具:释放生产力,革新业务运营
MediCa AI:AI赋能的智能医疗保健平台全面解析
兔展AI排版如何批量生成多尺寸图_兔展AI排版多尺寸批量生成步骤【实操】
Logic Pro 11更新全面解析:免费升级、AI功能与音乐制作流程
解密AI时尚摄影:打造完美形象的终极指南
Kling AI 2.5 Turbo:视频生成领域的颠覆者,深度评测与对比
Claude如何导出对话记录_Claude对话导出方法【方法】
ChatGPT 4o图像生成器:免费AI绘画技巧与应用
客户生命周期价值:终极商业增长策略
提升阅读理解:策略、技巧和有效方法全面指南
3步教你用AI将你的照片变成乐高积木风格
AI驱动的潜在客户挖掘:15分钟搭建营销机构并获利
智谱清言分析数据怎么用_智谱清言分析数据使用方法详细指南【教程】
文本分类:生成模型与朴素贝叶斯算法的全面指南
韵律分析:为什么理解音乐歌词的韵式至关重要?
播客数据深度分析:揭秘全球听众分布及增长策略
AI简历泛滥:虚假技能与企业衰落的深度剖析
AI视频创作终极指南:文本到视频的免费工具与技巧
使用Autogen框架进行业务分析和执行报告生成
MemeGIF Studio:AI驱动的GIF生成器全面评测与使用指南
快手本地生活AI如何预约景区火车票_快手AI本地生活抢票步骤【步骤】
ChatGPT一键生成PPT怎么加目录_ChatGPTPPT目录添加【步骤】
2023-07-06
南京市珐之弘网络技术有限公司专注海外推广十年,是谷歌推广.Facebook广告全球合作伙伴,我们精英化的技术团队为企业提供谷歌海外推广+外贸网站建设+网站维护运营+Google SEO优化+社交营销为您提供一站式海外营销服务。