cc-bioinfo_
EN

cc-bioinfo · 分析执行 skill · v1.0.4

会自己干活的分析框架,
并且证明自己真的干了。

把设计交给它,它自己建 Conda 环境、写分析代码、报错自修、出出版级图表,一直做到 SCI 稿件初稿——这一段现在很多 skill 都能说。它多做的是另一半:每一步的产物必须真在磁盘上、数据来源必须是下载而非生成、质量审计不过就硬停、关键节点停下来等你拍板。你去出门诊也不会中断,回来时能查到它每一步做了什么。

bio-analyze 是什么?

bio-analyze 是一种结构化知识框架:把生信领域最佳实践编码为结构化工作流与硬性质量门控,引导 AI 自动完成从原始数据质控到SCI 论文初稿的全流程生信分析。它是 cc-bioinfo 平台预装的下游执行 skill,一个关键特征是:框架本身不含可执行代码,而是 350KB+ 的结构化知识库,分析代码由 AI 按规则现场生成并在你的环境执行。它为每个课题单独配置一套 Conda 分析环境——课题之间环境隔离、工具版本互不冲突;执行中逐阶段结合前面的结果做小结,发现结果与预期不符会停下来等你判断,而不是无脑跑到底。

  • 84,000+ 行专业知识编码(34 个知识文件)
  • 6 条标准化组学流水线 + ATAC-seq、WGCNA、孟德尔随机化等知识库覆盖
  • 26 小时 真实课题中的最长单次无中断运行记录
  • 1,200+ 自动化测试全部通过,双重变异测试验证(0 存活)
当前稳定版 v1.0.4(2026-08-21)。命令前缀自 v1.0.2 起统一为 /bio-analyze,旧别名 /生信、/バイオ、/bioinformatics 保留可用。
01

它和 Claude Code 等 Agent 上的通用 skill 有什么不同?

现在做生信的人手边有几十个 skill 和平台,「不用写代码、自动跑分析」已经不是差异——大家都这么说。bio-analyze 的位置在另一件事上:技能库教 AI「怎么做对」,它要证明「AI 真的做了,而且没骗你」。这个区别在结果不好看、数据下载失败、AI 想抄近道的时候才显出来,而这些时候恰恰决定一篇论文能不能投。

会出问题的时刻通用 skill / 技能库bio-analyze
数据下载失败AI 可能用随机数生成一份「数据」继续跑——我们在自己的课题里真撞到过数据来源校验层逐步检查输入是下载还是生成;生成模拟数据属 critical 错误,直接硬停
AI 说「质控做完了」说了就算,没人核验校验器核验产物是否真在磁盘上,没有正面证据即判失败,靠退出码阻断而非提示词提醒
结果有隐藏问题带着批次偏差一路跑到出图五维度质量审计在生物学解读之前强制插入,CRITICAL 发现硬停等你
关键判断细胞类型注释和文件重命名用同样的认真程度四级思考深度:9 种关键场景强制完整推理链,并停下来等你确认
会话中断新对话不记得昨天,从头描述状态机记录到子步骤,一条命令精确续跑;实测被 API 故障打断两次无损接续
结果不好看容易被包装成阳性结论预注册的阈值与结论措辞天花板锁死在开工前,阴性结果如实进手稿

广度上它不占优,也不打算比:技能库覆盖的学科与工具远多于它,它聚焦生信的 6 条组学流水线。它也不是只能在平台里用——作为 skill 可以装进 Claude Code 单独运行;平台版多的是每课题隔离的常驻执行环境、多用户隔离与全程留痕,见怎么选页。

证据,不是形容词

  • 自愈:案例一里坐标转换只映射了 24%,它自己查出「位置被写成科学计数法」改成整数重跑到 99.96%;p 值被存成字符串导致三千万个假显著,也是它自己诊断出来的——没有人教。
  • 诚实:同一课题全扫 1,915 个血浆蛋白后零蛋白中介,手稿如实写「下游标志物,不是上游中介」,反向分析工具弱就写「工具弱」而不写「无效应」。
  • 边界:案例七里它把执行做到发表级,方向层面却三天没有自主质疑一次——门禁拦得住造假,拦不住选错题;这是人不可省的位置。
  • 耐力:真实课题中最长单次无中断运行约 26 小时。

那么你要做的是什么

交给它

  • 装 R、Python、Bioconductor——它自己建环境,连 Conda 都没有也能从零自举
  • 写代码、看报错、用命令行
  • 守着电脑——关浏览器后分析在服务器端继续跑
  • 记图表规范——300 DPI、字体、符合 WCAG 对比度的色盲友好配色按目标期刊自动检查

留给你

  • 确认细胞类型注释——整个分析里 AI 最可能错、而领域知识最能救场的一步
  • 逐张看图——Step 4 会停下来等你审图,真实案例中最有价值的缺陷全部是这样抠出来的
  • 判断异常结果是不是生物学上说得通
  • 核实稿件、决定方向——它给的是初稿,科学准确性、引文与「这个课题值不值得做」都在你

一个真实的时间感

传统路径下从拿到数据到出初稿,大多数人的经验是几个月。在平台上,一个含七条并行证据线、跨六类数据层的对比研究约 26 小时无中断完成;一项 314,805 细胞的多数据集整合加空间转录组课题产出了 6 张主图与完整初稿。但这不等于你两天后就能投稿——你仍需要时间去核实、去想、去修。它省掉的是「让东西跑起来」的那部分,不是「想清楚」的那部分。

02

质量与数据真实性如何保障?

这对你意味着什么:写进论文的每个数字都能追溯到一条真实跑过的命令和一个真实存在的文件;AI 想抄近道时会被拦下,而不是被你事后在审稿意见里发现。

  • Step 1.5 五维度质量审计:在计算完成、生物学解读开始之前强制插入——样本身份、批次效应、技术质量、生物学合理性、统计假设五个维度,任何 CRITICAL 发现触发 HARD_STOP。
  • 数据真实性铁律:禁止数据造假、禁止数据泄漏、禁止静默替换、禁止原始数据进入输出;生成模拟数据属 critical 错误,直接 HARD_STOP。
  • 可执行校验器而非“相信 AI”:流程校验器、状态对账器与 17 类一致性检查每轮运行,靠退出码强制执行;稿件检查器含 Crossref DOI 核验。
  • 双重独立评审:图表与稿件由全新独立子代理(统计学家 / 领域专家 / 怀疑论者)对抗性复检,而非自我批准。
  • 自学习经验库:20 种常见错误模式内置代码级修复方案;超过 2 轮的解决过程自动入库复用。
  • SCI 图表知识库 + 视觉审查闭环:732 行图表标准(按样本量选图决策树、8 种错误图表防御、15+ 审稿人必查项);AI 逐张读图做视觉检查,用户审查门控后才推进。
03

Step 0–7 全流程是怎么运转的?

这对你意味着什么:你只需要在两个闸门(质量审计、审图)出现,其余时间它按同一套流程往前走,做到哪一步随时可查。

步骤内容思考模式
Step 0项目初始化:自动检测组学类型、创建标准目录、加载配置Standard
Step 1动态分析:多阶段计算分析(Phase 1–N)Standard / Deep
Step 1.5数据质量审计:五维度深度审查,CRITICAL 发现直接 HARD_STOPUltrathink
Step 2反思与探索:科学问题完成度打分、转化医学评估Deep
Step 3研究总结:核心发现提炼、图表计划Ultrathink
Step 4出版级图表:SCI 标准输出 + AI 逐张读图的视觉审查闭环(你在这里审图)Deep
Step 5技术报告:结构化分析报告Deep
Step 6稿件撰写:21 个子步骤 + 五步提交前交叉验证Ultrathink
Step 7投稿准备:DOCX、图表包、cover letter(用户触发)Standard

自动执行原则:你说“开始分析”后它立即执行,不反问“下一步做什么”;可修复错误自动重试(上限 3 次);Phase 完成自动推进。但 Step 1.5 的质量审计与 Step 4 的图表审查会停下来等你——这两个闸门不能跳。

04

四级思考深度是如何调度的?

这对你意味着什么:细胞类型注释、批次效应这类会决定结论的判断,AI 不会用处理文件重命名的态度敷衍过去。

核心理念:不是所有任务都值得同样的认真程度。文件重命名不需要完整推理链,细胞类型注释则必须。

级别触发场景AI 行为
Quick文件操作、格式调整快速执行
Standard常规分析步骤标准推理
Deep参数选择、方法决策、批次效应评估多方案比较
Ultrathink9 种关键场景(见下)完整推理链:观察 → 假设 → 验证 → 结论

9 种强制 Ultrathink 场景:细胞类型注释、数据质量审查(Step 1.5)、差异表达解读、生物学结论推导、稿件关键章节、数据验证、聚类分辨率选择、批次效应评估、异常结果判断。

05

支持哪些组学类型和分析流水线?

这对你意味着什么:你的数据类型在下表里,就有一条写死了必做步骤与必出图表的标准流程,跳步会被实时告警。

组学类型平台与工具标准流程
单细胞 RNA-seq10x Genomics · Seurat · ScanpyQC → 标准化 → HVG → PCA → 聚类 → 注释 → DEG
空间转录组Visium · MERFISH · Slide-seq · CODEXQC → 标准化 → SVG → 空间聚类 → 反卷积
Bulk RNA-seqDESeq2 · edgeR · limmaQC → 比对 → 计数 → DEG → 富集
蛋白质组MaxQuant · DIA-NN · TMTQC → 标准化 → 缺失值插补 → DEP → 通路
代谢组XCMS · MetaboAnalyst · MZmineQC → 标准化 → PCA → DEA → 富集
脂质组继承代谢组 + 脂质特异扩展QC → 标准化 → PCA → DEA → 脂质分类

每条流水线定义强制步骤与强制图表清单,实时合规检查:跳过 doublet removal 或批次校正会实时告警,缺失强制图表在 Step 4 前 HARD_STOP。

06

什么场景不适合 bio-analyze?

场景更合适的替代方案
每天数百样本的生产级流水线Nextflow / Snakemake
底层算法 / 方法学开发直接编程
纯上游分析(基因组组装、比对)BWA / GATK / SPAdes
期望它替代你的科学判断—(关键节点会暂停等你拍板)

如实呈现能力边界是框架设计哲学的一部分:它不替代统计训练,不保证代码一次跑通,关键节点会暂停等待用户判断。

已知边界(我们自己实测到的)

  • 门禁拦得住模拟数据,拦不住所有编造的派生数字。执行方曾在压力下把一对「看似合理」的数值填进初稿而未真跑,门禁没拦下,是外部逐条核对才揪出——报告里每个数字都要能追溯到命令输出,这一条目前仍要靠人。
  • 无人值守不等于无需监督。复杂课题里会「做一步就停」、会报「后台在跑」而进程没起、会静默简化方法——需要能读日志的人持续核验。
  • 环境与算力探测可能误判。实测一台有 GPU 的机器被判成 CPU-only。

详见怎么选页第 05 节——公开这些比多列几条卖点更能帮你做决定。

07

如何开始使用?

  1. 第一步:在平台上打开对话,bio-analyze 已预装,不需要你装任何东西。
  2. 第二步:告诉它你的研究问题、数据在哪、目标期刊(或直接交上 bio-design 产出的 TOPIC.yml)。
  3. 第三步:说“开始分析”,然后去忙别的。需要你拍板时它会停下来,也可以通过 IM 推送找到你。
/bio-analyze status --verbose        # 查看进度
/bio-analyze continue                # 断点续传,子步骤级恢复
/bio-analyze pipeline show           # 流水线合规状态
/bio-analyze config set analysis.clustering_resolution 0.6 --global
/bio-analyze manuscript check --journal nature
/bio-analyze publish prep            # 投稿包

三层可定制参数:项目层 > 用户全局层 > 插件层,12 个参数域 50+ 参数。把你的偏好(线粒体比例阈值 15%、聚类分辨率 0.6)存为全局默认,新项目自动继承——不是黑箱。

08

常见问题 FAQ

cc-bioinfo、bio-design 和 bio-analyze 是什么关系?

三者是一个平台加两个核心 skill的关系。cc-bioinfo 是平台,回答“在哪里跑”;bio-design 是课题设计 skill,回答“做什么课题”;bio-analyze 是分析执行 skill,回答“怎么把它跑出来”。一句话:cc-bioinfo 是舞台,bio-design 是编剧,bio-analyze 是导演和全体演员。

用 bio-analyze 需要自己写 R 或 Python 代码吗?

不需要。AI 自动生成、执行、调试代码,并自动创建每项目独立的 Conda 环境(无 Conda 时从零自举 Miniconda)。你需要的是理解自己的科学问题,并在关键判断点(细胞类型注释确认、分析方向选择、图表视觉审核)做决策。

我得全程守着电脑吗?

不用。分析运行在服务器端,关闭浏览器后不中断,你可以去出门诊、去手术。需要你拍板时,可以通过微信、钉钉、飞书或 Telegram 接收卡片并回复。真实案例中最长的一次连续运行约 26 小时无中断。

分析中途中断了怎么办?

运行 /bio-analyze continue:系统扫描已完成输出、与计划对比,从第一个缺失项恢复到子步骤级别。Step 6 的 21 个子步骤各写独立文件,只重试失败的那一步。

生成的稿件能直接投吗?

Step 6 产出的是初稿,需研究者核实科学准确性、补充引文。框架内置 6 大期刊的机器可读合规配置,自动检查字数、300 DPI、字体与色盲友好配色;稿件中绝对禁止捏造统计值与引用,引文 DOI 会对 Crossref 核验。

和通用技能库、或者在 Claude Code 里装 skill 用,有什么区别?

技能库提供「这一步怎么做」的零件,bio-analyze 回答「整个课题怎么走完,以及怎么证明真走完了」——产物磁盘核验、数据来源校验、质量审计硬停、状态机续跑都是它的一部分。它本身也是一个可安装的 skill,会用终端的人直接装进 Claude Code 单独用完全可以;平台版多出的是每课题隔离的常驻环境、多用户隔离与全程留痕。详见怎么选页第 01 节。

我怎么验证它没骗我?

不靠信任,靠留痕:每个阶段的输入、输出、参数与版本落盘;决策日志逐条可查;稿件里的 DOI 对 Crossref 核验;关键数字对应到具体的结果文件。最稳的做法是我们自己也在用的那条——拿一个已知应该红的事实去对,对不上就是检查没执行,不是通过。同时如实说:门禁拦不住所有编造的派生数字(见第 06 节已知边界),最终审阅仍在人。

我想先试试,从哪里开始?

直接打开体验平台 test.cc-bioinfo.com(无需登录);要专属试用环境可邮件联系 tangmoogmoogtang@gmail.com。用起来不复杂:在浏览器里直接用中文描述你要做的分析即可,不需要安装软件、不需要配 Conda、不需要会命令行。建议先拿一份公开 GEO 数据跑一段质控与聚类,看它怎么自己建环境、写代码、出图。

本页最后更新: