cc-bioinfo · 分析执行引擎 · v1.0.2
不是又一个 AI 聊天机器人。
是一套会自己干活的分析框架。
你不用装环境、不用写代码、不用守着电脑。把设计交给它,它自己建 Conda 环境、写分析代码、报错自修、出出版级图表,一直做到 SCI 稿件初稿。你去出门诊也不会中断。
bio-analyze 是什么?
bio-analyze 是一种结构化知识框架:把生信领域最佳实践编码为结构化工作流与硬性质量门控,引导 AI 自动完成从原始数据质控到可投稿 SCI 论文初稿的全流程生信分析。它是 cc-bioinfo 平台的下游执行引擎,一个关键特征是:框架本身不含可执行代码,而是 350KB+ 的结构化知识库,分析代码由 AI 按规则现场生成并在你的环境执行。
- 84,000+ 行专业知识编码(34 个知识文件)
- 6 条标准化组学流水线 + ATAC-seq、WGCNA、孟德尔随机化等知识库覆盖
- 26 小时 真实课题中的最长单次无中断运行记录
- 1,200+ 自动化测试全部通过,双重变异测试验证(0 存活)
如果你是临床医生或研究生,这意味着什么?
下面那些 Step 与门控听起来很工程化。换成你的角度,实际体验是这样。
你不用做的事
- 不用装 R、Python、Bioconductor——它自己建环境,连 Conda 都没有也能从零自举
- 不用写代码,不用看懂报错,不用会命令行
- 不用守着电脑——关浏览器后分析在服务器端继续跑,你去出门诊、去手术都行
- 不用背图表规范——300 DPI、字体、符合 WCAG 对比度的色盲友好配色按目标期刊自动检查
你必须做的事
- 确认细胞类型注释——这是整个分析里 AI 最可能错、而领域知识最能救场的一步
- 逐张看图——Step 4 会停下来等你审图,真实案例中最有价值的缺陷全部是这样抠出来的
- 判断异常结果是不是生物学上说得通——比如某个基因在你的组织里本来就不该高表达
- 核实稿件——它给的是初稿,科学准确性与引文必须你把关
一个真实的时间感
传统路径下从拿到数据到出初稿,大多数人的经验是几个月。在平台上,一个含七条并行证据线、跨六类数据层的对比研究约 26 小时无中断完成;一项 314,805 细胞的多数据集整合加空间转录组课题产出了 6 张主图与完整初稿。但这不等于你两天后就能投稿——你仍需要时间去核实、去想、去修。它省掉的是“让东西跑起来”的那部分,不是“想清楚”的那部分。
Step 0–7 全流程是怎么运转的?
| 步骤 | 内容 | 思考模式 |
|---|---|---|
| Step 0 | 项目初始化:自动检测组学类型、创建标准目录、加载配置 | Standard |
| Step 1 | 动态分析:多阶段计算分析(Phase 1–N) | Standard / Deep |
| Step 1.5 | 数据质量审计:五维度深度审查,CRITICAL 发现直接 HARD_STOP | Ultrathink |
| Step 2 | 反思与探索:科学问题完成度打分、转化医学评估 | Deep |
| Step 3 | 研究总结:核心发现提炼、图表计划 | Ultrathink |
| Step 4 | 出版级图表:SCI 标准输出 + AI 逐张读图的视觉审查闭环(你在这里审图) | Deep |
| Step 5 | 技术报告:结构化分析报告 | Deep |
| Step 6 | 稿件撰写:21 个子步骤 + 五步提交前交叉验证 | Ultrathink |
| Step 7 | 投稿准备:DOCX、图表包、cover letter(用户触发) | Standard |
自动执行原则:你说“开始分析”后它立即执行,不反问“下一步做什么”;可修复错误自动重试(上限 3 次);Phase 完成自动推进。但 Step 1.5 的质量审计与 Step 4 的图表审查会停下来等你——这两个闸门不能跳。
四级思考深度是如何调度的?
核心理念:不是所有任务都值得同样的认真程度。文件重命名不需要完整推理链,细胞类型注释则必须。
| 级别 | 触发场景 | AI 行为 |
|---|---|---|
| Quick | 文件操作、格式调整 | 快速执行 |
| Standard | 常规分析步骤 | 标准推理 |
| Deep | 参数选择、方法决策、批次效应评估 | 多方案比较 |
| Ultrathink | 9 种关键场景(见下) | 完整推理链:观察 → 假设 → 验证 → 结论 |
9 种强制 Ultrathink 场景:细胞类型注释、数据质量审查(Step 1.5)、差异表达解读、生物学结论推导、稿件关键章节、数据验证、聚类分辨率选择、批次效应评估、异常结果判断。
支持哪些组学类型和分析流水线?
| 组学类型 | 平台与工具 | 标准流程 |
|---|---|---|
| 单细胞 RNA-seq | 10x Genomics · Seurat · Scanpy | QC → 标准化 → HVG → PCA → 聚类 → 注释 → DEG |
| 空间转录组 | Visium · MERFISH · Slide-seq · CODEX | QC → 标准化 → SVG → 空间聚类 → 反卷积 |
| Bulk RNA-seq | DESeq2 · edgeR · limma | QC → 比对 → 计数 → DEG → 富集 |
| 蛋白质组 | MaxQuant · DIA-NN · TMT | QC → 标准化 → 缺失值插补 → DEP → 通路 |
| 代谢组 | XCMS · MetaboAnalyst · MZmine | QC → 标准化 → PCA → DEA → 富集 |
| 脂质组 | 继承代谢组 + 脂质特异扩展 | QC → 标准化 → PCA → DEA → 脂质分类 |
每条流水线定义强制步骤与强制图表清单,实时合规检查:跳过 doublet removal 或批次校正会实时告警,缺失强制图表在 Step 4 前 HARD_STOP。
质量与数据真实性如何保障?
- Step 1.5 五维度质量审计:在计算完成、生物学解读开始之前强制插入——样本身份、批次效应、技术质量、生物学合理性、统计假设五个维度,任何 CRITICAL 发现触发 HARD_STOP。
- 数据真实性铁律:禁止数据造假、禁止数据泄漏、禁止静默替换、禁止原始数据进入输出;生成模拟数据属 critical 错误,直接 HARD_STOP。
- 可执行校验器而非“相信 AI”:流程校验器、状态对账器与 17 类一致性检查每轮运行,靠退出码强制执行;稿件检查器含 Crossref DOI 核验。
- 双重独立评审:图表与稿件由全新独立子代理(统计学家 / 领域专家 / 怀疑论者)对抗性复检,而非自我批准。
- 自学习经验库:20 种常见错误模式内置代码级修复方案;超过 2 轮的解决过程自动入库复用。
- SCI 图表知识库 + 视觉审查闭环:732 行图表标准(按样本量选图决策树、8 种错误图表防御、15+ 审稿人必查项);AI 逐张读图做视觉检查,用户审查门控后才推进。
什么场景不适合 bio-analyze?
| 场景 | 更合适的替代方案 |
|---|---|
| 每天数百样本的生产级流水线 | Nextflow / Snakemake |
| 底层算法 / 方法学开发 | 直接编程 |
| 纯上游分析(基因组组装、比对) | BWA / GATK / SPAdes |
| 期望它替代你的科学判断 | —(关键节点会暂停等你拍板) |
如实呈现能力边界是框架设计哲学的一部分:它不替代统计训练,不保证代码一次跑通,关键节点会暂停等待用户判断。
如何开始使用?
- 第一步:在平台上打开对话,bio-analyze 已预装,不需要你装任何东西。
- 第二步:告诉它你的研究问题、数据在哪、目标期刊(或直接交上 bio-design 产出的
TOPIC.yml)。 - 第三步:说“开始分析”,然后去忙别的。需要你拍板时它会停下来,也可以通过 IM 推送找到你。
/bio-analyze status --verbose # 查看进度
/bio-analyze continue # 断点续传,子步骤级恢复
/bio-analyze pipeline show # 流水线合规状态
/bio-analyze config set analysis.clustering_resolution 0.6 --global
/bio-analyze manuscript check --journal nature
/bio-analyze publish prep # 投稿包
三层可定制参数:项目层 > 用户全局层 > 插件层,12 个参数域 50+ 参数。把你的偏好(线粒体比例阈值 15%、聚类分辨率 0.6)存为全局默认,新项目自动继承——不是黑箱。
常见问题 FAQ
cc-bioinfo、bio-design 和 bio-analyze 是什么关系?
三者是一个平台加两个内置引擎的关系。cc-bioinfo 是平台,回答“在哪里跑”;bio-design 是设计引擎,回答“做什么课题”;bio-analyze 是执行引擎,回答“怎么把它跑出来”。一句话:cc-bioinfo 是舞台,bio-design 是编剧,bio-analyze 是导演和全体演员。
用 bio-analyze 需要自己写 R 或 Python 代码吗?
不需要。AI 自动生成、执行、调试代码,并自动创建每项目独立的 Conda 环境(无 Conda 时从零自举 Miniconda)。你需要的是理解自己的科学问题,并在关键判断点(细胞类型注释确认、分析方向选择、图表视觉审核)做决策。
我得全程守着电脑吗?
不用。分析运行在服务器端,关闭浏览器后不中断,你可以去出门诊、去手术。需要你拍板时,可以通过微信、钉钉、飞书或 Telegram 接收卡片并回复。真实案例中最长的一次连续运行约 26 小时无中断。
分析中途中断了怎么办?
运行 /bio-analyze continue:系统扫描已完成输出、与计划对比,从第一个缺失项恢复到子步骤级别。Step 6 的 21 个子步骤各写独立文件,只重试失败的那一步。
生成的稿件能直接投吗?
Step 6 产出的是初稿,需研究者核实科学准确性、补充引文。框架内置 6 大期刊的机器可读合规配置,自动检查字数、300 DPI、字体与色盲友好配色;稿件中绝对禁止捏造统计值与引用,引文 DOI 会对 Crossref 核验。
我想先试试,从哪里开始?
邮件联系 moogtang@gmail.com 获取试用。用起来不复杂:在浏览器里直接用中文描述你要做的分析即可,不需要安装软件、不需要配 Conda、不需要会命令行。建议先拿一份公开 GEO 数据跑一段质控与聚类,看它怎么自己建环境、写代码、出图。