Owkin MOSAIC计划:7种癌×千名患者的空间组学数据网,AI制药的燃料库

空逐月AI 前沿📡 觉醒AI2026-09-201270 阅读💛 283 收藏

一句话结论

MOSAIC 是 Owkin 牵头的空间组学数据联盟计划:在 7 个癌种上各收集约一千名患者的空间组学数据,规模比文献中已有最大研究(几十例样本)放大一到两个数量级。它的双重目标——把复杂癌症诊断拆解成生物学亚组实现精准医疗,以及为空间组学数据建立分析方法标准——决定了它是 AI 制药的底层燃料库:下游 AI 模型训练时调用的每一条数据都从这里来。对关注数据工程的人,这是一份”联盟模式做大数据集”的完整方法论。

MOSAIC 计划:跨医疗中心的空间组学数据网络

空间组学:在组织原位测分子表达

空间组学技术测的是 RNA 或蛋白质在组织、细胞空间上下文中的表达——不是把组织磨碎测平均値,而是保留空间坐标。研究者可以在肿瘤中选取多个不同区域,逐一做分子级解析。

这为什么重要?临床报告已经发现,癌细胞和免疫细胞的空间组织方式可能决定对特定药物的敏感性。但目前只能判断”空间分布有影响”,还达不到”用空间分布做临床决策”的效用。要跨过这道坎,就需要几千名患者、几千份样本、几千种蛋白和基因规模的数据库——这正是 MOSAIC 的立项逻辑。

空间组学技术:从组织到分子空间图谱

千例规模为什么是质变

空间组学技术刚进入各医疗中心时,文献中最大的研究只有几十份样本——技术太新、成本太高。MOSAIC 直接把目标定为每个癌种一千名患者,跨 7 个癌种。这不是渐进式扩容,而是让统计功效跨过”发现亚组”门槛的必要条件:癌症精准医疗的前提是把复杂诊断拆成生物学上不同的亚组,每组各有适用的药物策略。

规模跃迁:从几十例到千例样本

Owkin 的角色:深度学习+组织基因组学积累

为什么由 Owkin 主导?官方给出两个理由:一是多年深度学习模型经验——空间组学数据信息复杂度前所未有,构建分析流程时训练深度学习模型是当前主流做法;二是 Owkin 在组织基因组学上的长期积累,研究影像特征与分子谱的关联,正好连接”病理图像”和”分子数据”两个世界。

合作方提供了两大空间组学平台(GeoMx 与 CosMx),其中 GeoMx 是该领域最早的自动化商业方案之一。多家医疗中心以协作研究形式加入,联盟明确欢迎更多学术与产业伙伴。

深度学习分析千例级多模态空间数据

对数据团队的借鉴

MOSAIC 的做法可迁移到任何”数据瓶颈”行业:单一机构的数据量不足以训练可靠模型时,用联盟模式汇集多中心数据;技术上把最权威的合作方拉进来构建并评估分析标准;数据规模设计围绕明确的统计目标(发现亚组),而非拍脑袋的数字。数据集建设本身就是护城河——这是 Owkin 用 MOSAIC 验证的判断。

原文信息

  • 原视频标题:MOSAIC | The multimodal patient data that powers AI for pharma
  • 频道:Owkin
  • 讲者:Owkin 及合作医疗中心研究团队
  • 发布日期:2026-05-13
  • 视频时长:约 5 分钟

文章评论(0

暂无评论,快来抢沙发~