cc-bioinfo_
EN

cc-bioinfo · 分析执行引擎 · v1.0.2

不是又一个 AI 聊天机器人。
是一套会自己干活的分析框架。

你不用装环境、不用写代码、不用守着电脑。把设计交给它,它自己建 Conda 环境、写分析代码、报错自修、出出版级图表,一直做到 SCI 稿件初稿。你去出门诊也不会中断。

bio-analyze 是什么?

bio-analyze 是一种结构化知识框架:把生信领域最佳实践编码为结构化工作流与硬性质量门控,引导 AI 自动完成从原始数据质控到可投稿 SCI 论文初稿的全流程生信分析。它是 cc-bioinfo 平台的下游执行引擎,一个关键特征是:框架本身不含可执行代码,而是 350KB+ 的结构化知识库,分析代码由 AI 按规则现场生成并在你的环境执行。

  • 84,000+ 行专业知识编码(34 个知识文件)
  • 6 条标准化组学流水线 + ATAC-seq、WGCNA、孟德尔随机化等知识库覆盖
  • 26 小时 真实课题中的最长单次无中断运行记录
  • 1,200+ 自动化测试全部通过,双重变异测试验证(0 存活)
当前稳定版 v1.0.2(2026-06-22)。命令前缀自 v1.0.2 起统一为 /bio-analyze,旧别名 /生信、/バイオ、/bioinformatics 保留可用。
01

如果你是临床医生或研究生,这意味着什么?

下面那些 Step 与门控听起来很工程化。换成你的角度,实际体验是这样。

你不用做的事

  • 不用装 R、Python、Bioconductor——它自己建环境,连 Conda 都没有也能从零自举
  • 不用写代码,不用看懂报错,不用会命令行
  • 不用守着电脑——关浏览器后分析在服务器端继续跑,你去出门诊、去手术都行
  • 不用背图表规范——300 DPI、字体、符合 WCAG 对比度的色盲友好配色按目标期刊自动检查

你必须做的事

  • 确认细胞类型注释——这是整个分析里 AI 最可能错、而领域知识最能救场的一步
  • 逐张看图——Step 4 会停下来等你审图,真实案例中最有价值的缺陷全部是这样抠出来的
  • 判断异常结果是不是生物学上说得通——比如某个基因在你的组织里本来就不该高表达
  • 核实稿件——它给的是初稿,科学准确性与引文必须你把关

一个真实的时间感

传统路径下从拿到数据到出初稿,大多数人的经验是几个月。在平台上,一个含七条并行证据线、跨六类数据层的对比研究约 26 小时无中断完成;一项 314,805 细胞的多数据集整合加空间转录组课题产出了 6 张主图与完整初稿。但这不等于你两天后就能投稿——你仍需要时间去核实、去想、去修。它省掉的是“让东西跑起来”的那部分,不是“想清楚”的那部分。

02

Step 0–7 全流程是怎么运转的?

步骤内容思考模式
Step 0项目初始化:自动检测组学类型、创建标准目录、加载配置Standard
Step 1动态分析:多阶段计算分析(Phase 1–N)Standard / Deep
Step 1.5数据质量审计:五维度深度审查,CRITICAL 发现直接 HARD_STOPUltrathink
Step 2反思与探索:科学问题完成度打分、转化医学评估Deep
Step 3研究总结:核心发现提炼、图表计划Ultrathink
Step 4出版级图表:SCI 标准输出 + AI 逐张读图的视觉审查闭环(你在这里审图)Deep
Step 5技术报告:结构化分析报告Deep
Step 6稿件撰写:21 个子步骤 + 五步提交前交叉验证Ultrathink
Step 7投稿准备:DOCX、图表包、cover letter(用户触发)Standard

自动执行原则:你说“开始分析”后它立即执行,不反问“下一步做什么”;可修复错误自动重试(上限 3 次);Phase 完成自动推进。但 Step 1.5 的质量审计与 Step 4 的图表审查会停下来等你——这两个闸门不能跳。

03

四级思考深度是如何调度的?

核心理念:不是所有任务都值得同样的认真程度。文件重命名不需要完整推理链,细胞类型注释则必须。

级别触发场景AI 行为
Quick文件操作、格式调整快速执行
Standard常规分析步骤标准推理
Deep参数选择、方法决策、批次效应评估多方案比较
Ultrathink9 种关键场景(见下)完整推理链:观察 → 假设 → 验证 → 结论

9 种强制 Ultrathink 场景:细胞类型注释、数据质量审查(Step 1.5)、差异表达解读、生物学结论推导、稿件关键章节、数据验证、聚类分辨率选择、批次效应评估、异常结果判断。

04

支持哪些组学类型和分析流水线?

组学类型平台与工具标准流程
单细胞 RNA-seq10x Genomics · Seurat · ScanpyQC → 标准化 → HVG → PCA → 聚类 → 注释 → DEG
空间转录组Visium · MERFISH · Slide-seq · CODEXQC → 标准化 → SVG → 空间聚类 → 反卷积
Bulk RNA-seqDESeq2 · edgeR · limmaQC → 比对 → 计数 → DEG → 富集
蛋白质组MaxQuant · DIA-NN · TMTQC → 标准化 → 缺失值插补 → DEP → 通路
代谢组XCMS · MetaboAnalyst · MZmineQC → 标准化 → PCA → DEA → 富集
脂质组继承代谢组 + 脂质特异扩展QC → 标准化 → PCA → DEA → 脂质分类

每条流水线定义强制步骤与强制图表清单,实时合规检查:跳过 doublet removal 或批次校正会实时告警,缺失强制图表在 Step 4 前 HARD_STOP。

05

质量与数据真实性如何保障?

  • Step 1.5 五维度质量审计:在计算完成、生物学解读开始之前强制插入——样本身份、批次效应、技术质量、生物学合理性、统计假设五个维度,任何 CRITICAL 发现触发 HARD_STOP。
  • 数据真实性铁律:禁止数据造假、禁止数据泄漏、禁止静默替换、禁止原始数据进入输出;生成模拟数据属 critical 错误,直接 HARD_STOP。
  • 可执行校验器而非“相信 AI”:流程校验器、状态对账器与 17 类一致性检查每轮运行,靠退出码强制执行;稿件检查器含 Crossref DOI 核验。
  • 双重独立评审:图表与稿件由全新独立子代理(统计学家 / 领域专家 / 怀疑论者)对抗性复检,而非自我批准。
  • 自学习经验库:20 种常见错误模式内置代码级修复方案;超过 2 轮的解决过程自动入库复用。
  • SCI 图表知识库 + 视觉审查闭环:732 行图表标准(按样本量选图决策树、8 种错误图表防御、15+ 审稿人必查项);AI 逐张读图做视觉检查,用户审查门控后才推进。
06

什么场景不适合 bio-analyze?

场景更合适的替代方案
每天数百样本的生产级流水线Nextflow / Snakemake
底层算法 / 方法学开发直接编程
纯上游分析(基因组组装、比对)BWA / GATK / SPAdes
期望它替代你的科学判断—(关键节点会暂停等你拍板)

如实呈现能力边界是框架设计哲学的一部分:它不替代统计训练,不保证代码一次跑通,关键节点会暂停等待用户判断。

07

如何开始使用?

  1. 第一步:在平台上打开对话,bio-analyze 已预装,不需要你装任何东西。
  2. 第二步:告诉它你的研究问题、数据在哪、目标期刊(或直接交上 bio-design 产出的 TOPIC.yml)。
  3. 第三步:说“开始分析”,然后去忙别的。需要你拍板时它会停下来,也可以通过 IM 推送找到你。
/bio-analyze status --verbose        # 查看进度
/bio-analyze continue                # 断点续传,子步骤级恢复
/bio-analyze pipeline show           # 流水线合规状态
/bio-analyze config set analysis.clustering_resolution 0.6 --global
/bio-analyze manuscript check --journal nature
/bio-analyze publish prep            # 投稿包

三层可定制参数:项目层 > 用户全局层 > 插件层,12 个参数域 50+ 参数。把你的偏好(线粒体比例阈值 15%、聚类分辨率 0.6)存为全局默认,新项目自动继承——不是黑箱。

08

常见问题 FAQ

cc-bioinfo、bio-design 和 bio-analyze 是什么关系?

三者是一个平台加两个内置引擎的关系。cc-bioinfo 是平台,回答“在哪里跑”;bio-design 是设计引擎,回答“做什么课题”;bio-analyze 是执行引擎,回答“怎么把它跑出来”。一句话:cc-bioinfo 是舞台,bio-design 是编剧,bio-analyze 是导演和全体演员。

用 bio-analyze 需要自己写 R 或 Python 代码吗?

不需要。AI 自动生成、执行、调试代码,并自动创建每项目独立的 Conda 环境(无 Conda 时从零自举 Miniconda)。你需要的是理解自己的科学问题,并在关键判断点(细胞类型注释确认、分析方向选择、图表视觉审核)做决策。

我得全程守着电脑吗?

不用。分析运行在服务器端,关闭浏览器后不中断,你可以去出门诊、去手术。需要你拍板时,可以通过微信、钉钉、飞书或 Telegram 接收卡片并回复。真实案例中最长的一次连续运行约 26 小时无中断。

分析中途中断了怎么办?

运行 /bio-analyze continue:系统扫描已完成输出、与计划对比,从第一个缺失项恢复到子步骤级别。Step 6 的 21 个子步骤各写独立文件,只重试失败的那一步。

生成的稿件能直接投吗?

Step 6 产出的是初稿,需研究者核实科学准确性、补充引文。框架内置 6 大期刊的机器可读合规配置,自动检查字数、300 DPI、字体与色盲友好配色;稿件中绝对禁止捏造统计值与引用,引文 DOI 会对 Crossref 核验。

我想先试试,从哪里开始?

邮件联系 moogtang@gmail.com 获取试用。用起来不复杂:在浏览器里直接用中文描述你要做的分析即可,不需要安装软件、不需要配 Conda、不需要会命令行。建议先拿一份公开 GEO 数据跑一段质控与聚类,看它怎么自己建环境、写代码、出图。