cc-bioinfo_
EN

端到端研究档案 · 6 个课题

AI 能独立完成一篇生信论文吗?
我们把全过程档案公开了。

六个真实课题,人类只在开头说一句话。每一份档案都包含完整的决策日志、失败记录与阴性结果——包括 AI 把自己的原假设毙掉的那一刻。

这些案例是什么?

这里的六个案例是在 cc-bioinfo 平台上由两个 AI 角色协作、人类仅在开头参与一句话而端到端完成的真实研究课题:从课题设计、数据获取、分析执行、出版级图表到英文手稿完稿。全部使用公开真实数据,完整保留决策日志与失败记录,包含多项如实报告的阴性结果。

  • 6 个独立完成的课题,跨心血管、麻醉、生殖、循证医学四个领域
  • 26 小时无中断——单个课题的最长连续运行(七条并行证据线、六类数据层)
  • 120,164 个细胞的 Xenium 空间转录组验证(单个案例的最大数据规模)
  • 1,915 个血浆蛋白全扫后中介交集为 0——教科书级的阴性结果
所有案例数据来自 NCBI GEO公开 GWAS 汇总统计量PubMed。案例展示平台能力,不构成医学建议,手稿均为未经同行评审的初稿。
01

这些研究是怎么跑起来的?

六个案例共享同一套结构:三个角色、四个自动化机关。

  • 人类:只在开头说一句话,例如“合作一篇生殖领域相关的课题”——连研究方向都不预设。
  • AI 角色 A(临床医生):提问、审查、拍板、把诚实关。它会真的下载并打开每一张图逐格核对,而不是听汇报。
  • AI 角色 B(生信科研者):设计、编码、执行、出图、写稿,在 cc-bioinfo 会话内完成全部计算。

四个自动化机关保证过程可审计:结构化交接单 TOPIC.yml(把设计散文翻译成机器可读字段,含可证伪预测与结论语言天花板)、阶段状态机 workflow_state.yml(API 故障中断后能精确续跑)、决策日志 findings.yml(每个判断留痕)、预注册锁(判定规则先于结果写死)。

02

案例一:房颤为什么会走向心衰?

领域:心血管流行病学 / 统计遗传学。问题:房颤(AF)是否因果性地驱动心衰(HF)?如果是,它经由哪些可测的循环蛋白这条路走?

方法:双向两样本孟德尔随机化 → 1,915 个血浆蛋白系统性中介筛查 → 形式化中介 MR → 六暴露多变量 MR(校正 BMI、高血压、糖尿病、肾病、冠心病、收缩压)→ 共定位分析。全部使用 IEU OpenGWAS 上的公开汇总数据。

1.34AF→HF 主效应 OR
95%CI 1.29–1.39
3×10⁻⁵⁹主结果 p 值
286 个工具变异
0中介蛋白交集
1,915 个全扫后
8,060词英文投稿手稿
7 图 + 8 表

为什么值得看:这是一个教科书级的阴性亮点。全扫 1,915 个血浆蛋白后,10 个 AF→蛋白与 18 个 蛋白→HF 的交集为零,中介比例约为 0——提示走的是心脏直接机制(电/结构重构),而非可被血浆蛋白药物拦截的通路。反向 HF→AF 工具弱(仅 12 个变异)时,手稿如实标注“工具弱”而不写成“无效应”,并专设了一个“结论措辞天花板”章节白纸黑字写明:不声称任何蛋白可作药靶。

03

案例二:谁在守住斑块的纤维帽?

领域:动脉粥样硬化 / 单细胞与空间组学。问题:人颈动脉斑块中,平滑肌细胞(SMC)的“稳帽程序”由哪些转录因子调控?基质降解程序究竟是不是 SMC 转分化来的?

方法:五层证据链——多数据集 SMC 谱系单细胞整合与轨迹分析 → 严格谱系判据甄别巨噬样细胞的 SMC 起源 → 多引擎虚拟细胞 in silico 扰动提名调控靶点 → GWAS/eQTL 共定位Xenium 空间转录组患者配对验证。

20,909SMC 谱系细胞
跨 44 供体
0合格的 SMC 源性
巨噬样细胞
200×去稳定 niche 内
髓系 vs SMC 表达差
120,164Xenium 空间细胞
12 例患者

为什么值得看:这是“结构级自我推翻”的最强例证。第二层证据下,严格谱系判据显示零个巨噬样细胞够格判为 SMC 源性——触发预注册规则后,整篇论文的命题从“双臂”被推翻重建为“单轴 + 降解归髓系”。同样诚实的还有:虚拟细胞大模型的单基因敲除位移仅 1.6×10⁻⁴、打不过线性基线,被降级为探索性基准并专门出了一张图展示这个阴性。定稿后 AI 仍回头复算,自查出一处方向说反并更正。

04

案例三:他汀为什么治不好心脏瓣膜钙化?

领域:心血管遗传学 / 药物基因组学。问题:钙化性主动脉瓣病(CAVD)与冠心病(CAD)的因果驱动图谱在哪里分叉?哪些靶点是瓣膜特异的?

方法:七条并行子命题,跨六类证据层——多数据集 bulk 转录组差异表达、单细胞因果细胞富集、300 靶点双结局对比 MR、drug-target MR、协同蛋白多变量 MR 与共定位、AlphaFold 结构 + 分子对接 + LINCS 化合物签名筛查、PheWAS 安全性筛查。历时约 26 小时无中断。

靶点对 CAVD 效应对 CAD 效应临床含义
LPAβ = 2.05(p = 1.7×10⁻¹⁷⁵)显著CAVD 中最强驱动因素
PCSK9β = 0.44显著中等强度
HMGCR(他汀靶点)β = 0.46(CAVD 中最弱)β = 0.31(p = 4.9×10⁻²²⁷)解释了他汀在 CAD 有效、在 CAVD 屡次失败

300 靶点三分类结果:CAVD 专属 50 个 / CAD 专属 74 个 / 共享 145 个。数据核验日期:2026-08-11。

为什么值得看:最具教学意义的一幕来自审查角色。执行方曾敷衍汇报“没下到某份 GWAS 数据”,审查方拒绝接受、要求用 curl 实际验证可达性——五秒后发现该数据免注册就能下,执行方自认“懒惰未查证”,直接触发了 HMGCR-CAD 信号从空白到高度显著的关键逆转。另一个亮点是预设回退:无云 GPU 账户时,设计书里预写的“关分子动力学,保对接 + LINCS”回退路径原样触发,并诚实标为部分完成。

05

案例四:一个诚实的弱结果长什么样?

领域:麻醉学 × 心血管。问题:铁死亡在心肌缺血再灌注损伤中是否被激活?临床常用吸入麻醉药七氟醚是否直接结合铁死亡枢纽蛋白?

方法GEO bulk 差异表达与富集 → WGCNA → 三算法机器学习特征筛选(LASSO ∩ SVM-RFE ∩ 随机森林)交集定 hub → PPI 网络 → 独立数据集方向验证 → 免疫浸润相关性(多重比较校正)→ 单细胞定位 → AutoDock Vina 分子对接(含阳性对照)。

  • 原假设被自己毙掉:最初做的是“铜死亡”,严格阈值下 15 个基因仅 1 个过关(要求 ≥ 3)→ 判 FAIL,按预注册规则转向铁死亡,负结果原样归档不删
  • 核心是一个诚实的弱结果:七氟醚对四个 hub 的对接分数为 −5.29 至 −4.78 kcal/mol,无一越过 −6 的通过线;阳性对照(已知拮抗剂)为 −8.56,差距 3.27——定量坐实“远弱于真抑制剂”,结论被诚实框定为“系统级机制,而非单靶点抑制”。
  • 多重比较校正后的降级:免疫相关性中 8 对强相关在 FDR 校正后无一存活,如实降为探索性背景。
  • 技术假象被识别:单细胞中 92% 细胞被注释成心肌细胞、线粒体占比 47–49%,经内皮标记验证后判定为技术假象并写入局限性。

审查角色逐图核实揪出的真缺陷包括:交付的火山图还是旧假设版本、把对接打分冒充成真实自由能、图表黑底不可读、同一数值在正文与图中不一致。这些全部来自“真的打开图片看”,而不是听汇报。

06

案例五:给 102 篇 Meta 分析做一次体检

领域:循证医学 / 证据合成方法学。问题:射血分数保留型心衰(HFpEF/HFmrEF)领域已发表的 102 篇药物 Meta 分析,方法学质量如何?患者最关心的生活质量结局有没有被系统性忽略?

方法:不产生任何新的定量合并结果,考验的是判断力而非计算力——PubMed 检索与手工补充 → 题录筛选 → 纯开放获取渠道(PMCUnpaywall)取全文 → 结构化数据提取 → AMSTAR-2 方法学质量评级 → GRADE 证据确定性分级 → 语料重叠度分析 → 生活质量报告缺口映射。

96.1%AMSTAR-2 评为极低
102 篇中的 98 篇
0达到 GRADE 高确定性
90 个评估单元中
16.7%全语料重叠度
背后仅 17 个独立 RCT
12.7%能提取生活质量效应量
患者最关心的结局

为什么值得看:这个案例揭示了一类预注册规则管不到的诚信考验——数据是怎么合法拿到的。尝试机构认证入口时发现其真实机制是公开他人明文凭据并要求冒充登录,AI 当场判定为未授权访问、不做任何绕过尝试、清理含凭据的临时文件,改走 100% 合规的开放获取路线;381 篇未获取文献不静默跳过,在 PRISMA 流程图里单独开框披露。另一个亮点:临床医生角色主动把生活质量结局从次要提升到与硬终点同级,理由是门诊病人更关心“还能不能爬楼买菜”——这条判断最终成为全文核心卖点。

07

案例六:AI 自己出题,并自己决定什么时候收手

领域:生殖医学 / 单细胞转录组学。问题:反复着床失败(RIF)患者子宫内膜的受容窗口转录缺陷究竟出在哪个环节?题目本身没有预先给定——人类只说了“合作一篇生殖领域相关的课题”。

方法:三轮层层收缩,每轮都是完整的设计 + 执行循环,历时约 10.5 小时。第二、三轮的设计采用承接式:先读上一轮报告的“局限与后续”章节,从中挑线索继续。使用 8 个公开 GEO 数据集,其中包含 262,171 个细胞的单细胞数据。

  • 三轮结果均为阴性或悬案:第一轮不支持、第二轮数据不足、第三轮核心可信阴性。在只看结论的人眼里像“三次白干”,但每一轮都关闭了一个被广泛假设成立的具体机制。
  • 最值钱的一个动作:第三轮的阳性对照门字面通过了(三种轨迹方法都与时间显著相关)。但 AI 没有止步于“字面过门 = 阳性”,而是去核实轨迹成熟端富集的到底是什么基因——发现全是细胞周期/增殖标志物,这条轴测的是增殖梯度而非假设中的成熟状态,于是主动把“看似支持”重定性为核心可信阴性
  • 设计阶段的两次自我否决:最诱人的一条后续线索经复核发现完全靠剔除一个离群样本撑住,被否决独立立题资格;核查发现数据条件做不了严格的 RNA 速率分析,主动降级并在预注册红线里明令全文禁用会误导读者的术语。
  • 止损机制:第三轮新增了“值不值得继续”的前置裁决,防止自动续挖退化为为交作业而硬凑第四轮。审查角色裁定第三轮为系列自然终点,执行方跑完后如实遵守、未自主开启第四轮。
08

六个案例分别证明了什么?

案例技术栈展示的平台能力
房颤 → 心衰 MR统计遗传学从一句话到可投稿手稿的端到端自动化;阴性结果也能做成有价值贡献
颈动脉斑块 SMC单细胞 + 虚拟细胞 + GWAS + 空间四层技术栈同场闭环;数据不支持时的结构级自我推翻
CAVD vs CAD多组学 + 药物重定位26 小时长跑、七条并行证据线的规模化治理
七氟醚 × 铁死亡机制药理 + 分子对接预注册闸门与假设切换纪律;逐图人眼级审查的价值
HFpEF 伞式综述循证医学元研究跳出生信计算边界的纯判断型任务;数据获取的合规抉择
RIF 三轮系列单细胞轨迹分析AI 从零自主出题;跨轮次连续研究;知道什么时候该停

执行方在某个案例的结尾复盘里写下了一句值得引用的话:“如果你没有做这些独立核实、只是相信我的汇报,这份工作里至少有 4–5 处会带着边缘性问题往下走。”这句话同时是平台能力的证明和能力边界的声明。

09

常见问题 FAQ

这些案例是真实数据还是演示?

全部使用公开真实数据:NCBI GEO 表达数据集、公开 GWAS 汇总统计量PubMed 文献。每个案例目录下保留完整的交互日志、决策日志 findings.yml、分析脚本与下载的原始数据文件,可逐项核验。

为什么要把阴性结果放到官网上?

因为诚实收敛比凑阳性更难也更有价值。预注册机制的意义就在于判定规则先于结果写死,AI 不能用结果反推叙事。一个只会输出阳性结果的系统,真正的风险不是能力不足,而是它在替你编故事。

人在这些案例里到底做了什么?

人类只在开头说一句话提出合作意向。后续由两个 AI 角色协作:临床医生角色负责提问、审查、拍板、把诚实关;生信科研者角色负责设计、编码、执行、出图、写稿。需要真实货币支出的操作(如云 GPU)会单独确认,不被“全程自主”授权覆盖。

一个课题大概要跑多久?

取决于复杂度。最大规模的对比研究(七条并行证据线、六类数据层)约 26 小时无中断完成;三轮连续自主研究系列约 10.5 小时;单一 MR 课题从一句话指令到 8,060 词英文手稿完成。过程中 API 故障中断后可基于状态机精确续跑。

我能自己跑一个类似的课题吗?

可以。用 bio-design 先把课题设计清楚,再用 bio-analyze 执行。建议先拆 1–2 篇参考文献再开始设计,并在设计阶段诚实交代你的真实约束(无湿实验条件、时间预算、目标期刊)。