cc-bioinfo_
EN

cc-bioinfo · 课题设计引擎

在写第一行代码之前,先把方案想对。

AI 提问,你思考——方案是你的,不是 AI 的。不需要会编程,也不需要先懂统计;你只需要带着临床问题进来,1 到 2 小时后带走一份能直接给导师看的方案书。

bio-design 是什么?

bio-design 是一个生信科研分析设计插件:在写第一行代码之前,通过启发式对话帮你把“模糊的课题想法”变成“可执行的分析设计”,并能把已发表论文的分析思路拆解为可复用经验。它是 cc-bioinfo 平台的上游设计引擎,产出机器可读的设计契约 TOPIC.yml 与完整设计书 design.md,直接交给 bio-analyze 执行。

  • 382 个已拆解案例:scRNA-seq 图谱、多组学整合、MR 因果、分子对接、空间转录组等
  • 6,235 条活跃决策模式:统计设计 1,468 · 对照设计 1,399 · 证据边界 1,381 · 科学洞察 975
  • 546 条陷阱预警(TRAP),每一条都来自已发表文献中的真实错误
  • 1–2 小时 一次完整设计对话的典型耗时
知识库数字为 2026-08 实测值,随使用持续增长。bio-design 为商业许可(Commercial EULA)插件,非开源协议。
01

如果你是临床医生或研究生,这意味着什么?

前面那些机制听起来很工程化。换成你的角度,实际情况是这样。

你需要具备什么

  • 不需要会写 R 或 Python,不需要先懂统计方法,不需要会用命令行
  • 需要你的临床判断:你的病人群体是什么、你真正想回答的问题是什么
  • 需要你能判断哪个结局对病人真的有意义——这是 AI 最缺的东西

你要付出什么

  • 1–2 小时的一次完整对话(可以中断,/bio-design continue 接着聊)
  • 在关键决策点真的去想并回答——它会停下来等你,不会替你拿主意
  • 诚实交代你的现实约束:没有湿实验条件、只有半年、目标期刊影响因子多少

你最后拿到的东西

一份 design.md——这是一份你能直接打印出来给导师、给科室、给伦理委员会看的方案书,不是一堆只有程序员看得懂的配置。它里面有:你的研究命题与拆解后的子问题、每个子问题打算用什么证据回答、图表计划、数据从哪里拿、哪些结论你这个设计根本达不到,以及路走不通时的备选方案。章节结构参照 EQUATOR Network 收录的报告规范(观察性研究对应 STROBE、孟德尔随机化对应 STROBE-MR),写稿时可以直接对应过去。

一个你可能会觉得碍事、但实际在保护你的设计

它会在你还没开始做之前就告诉你:以你这个设计,结论最多只能写到“相关”,写不到“导致”。刚开始听着像泼冷水,但这正是审稿人最常拒稿的理由之一——在写之前知道,比在返修意见里知道便宜得多。

02

文献拆解是怎么工作的?

文献拆解的目标不只是理解一篇论文的作者怎么做,更重要的是为什么这么选。如果你想先体验一下,这是最好的入口:丢一篇你领域的参考文献进去,你会直接看到它把那篇论文拆成了什么。

  1. 第一步 · 快速预筛/bio-design scan 约 30 秒判断一篇文献是否值得深入,支持整目录递归与批量提交;预筛链包含去重检查、信息抽取、证据链快速评估,还会检索外部引用语境——看别人是支持还是反驳这篇文章。
  2. 第二步 · 完整拆解:上传 PDF 后输入 /bio-design,逐模块深度解构:每个 Results 小节为一个模块,标注 L1–L6 证据等级、科学子问题、方法工具、关键参数、输入输出。
  3. 第三步 · 三维度追问:每个模块额外抽取方法选择理由、前提条件、局限性;若原文未说明,明确标注“作者未陈述”——这个缺失本身就是评估论文严谨度的信息。
  4. 第四步 · 无全文时的诚实降级:只有标题或 DOI 时进入 Pre-SCAN 模式,基于 PubMed 摘要页按置信度分层标注、明确划出“我不知道”的边界,防止 AI 脑补污染知识库。

支持格式:PDF / TXT / Markdown / DOCX / DOC / RTF / HTML / URL;非生信论文(实验、综述、临床)走方法学提取路线,抽取可迁移的设计模式。

03

分析设计对话是怎样的流程?

带着课题或数据进来,通过启发式对话产出一份完整的分析设计文档。核心原则:不替用户做决定,而是引导用户自己想清楚。对话方式不是问“你想做什么”,而是“在类似情况下 XX 策略有效/无效,对你的情况我建议 YY,你怎么看?”

阶段内容
PRE-ROUTE碰撞检测:先查已有课题避免重复建题
PRE-PHASE画像采集:结构化提问(数据 / 方向 / 约束),自动路由交互模式
Phase 1命题澄清 → 结论强度校准 → 机制深度选择 → 数据可行性预检索(真实搜 GEO/IEU OpenGWAS/PDB,不靠记忆)
Phase 1.5经验匹配:五步引擎内部推理,自然融入对话而非信息轰炸
Phase 2子命题拆解 → 陷阱识别 → 证据链设计 → 缺口处理 → 五道自检(完整性 / 逻辑 / 非冗余 / 措辞匹配 / 桥接合理)
Phase 3输出 design.md + 数据采集清单 + 会话快照

design.md 强制包含:研究命题与子命题证据计划、证据链地图、可达 vs 不可达结论、故障排查与应急预案、必报基因清单、统计单元声明、预注册决策规则——从设计阶段就杜绝事后挑数据。

04

六级证据体系与措辞天花板是什么?

L1–L6 六级证据体系是全插件的“共同语言”:把你计划做的每一步分析映射到具体的证据强度上。它与循证医学里的 GRADE牛津 OCEBM 证据等级同源,但针对生信分析的具体方法做了重新划分。硬规则只有一条:结论强度 ≤ 最关键那一层证据的强度

等级含义结论天花板(示例)
L1 观察差异表达、相关性描述“X 与 Y 相关 / X is associated with Y”
L2 稳健性多数据集、多方法交叉验证“在多个独立队列中稳健 / robust across cohorts”
L3 特异性排除替代解释“特异于…而非… / specific to”
L4 因果MR、干预、时序设计“X 因果影响 Y / causally influences”
L5 机制通路、分子相互作用“通过…通路介导 / mediated via”
L6 验证独立实验验证“经独立验证证实 / experimentally validated”

L3 / L4 / L5 是正交维度而非递进台阶——“跳过 L3 直接做 L4”是合法的设计选择。

一个来自投稿策略地图的反直觉洞察:影响因子与证据层数并不正相关——知识库中 3 层证据的案例发了 IF 10.3,5 层的只发了 IF 6。单层做到极致胜过多层浅覆盖,投稿策略匹配比证据链本身更重要。对临床研究者而言这意味着:不必因为“我做不了实验验证”就放弃好期刊。

05

TRAP 陷阱预警如何保护你的论文?

知识库中的 546 条 TRAP,每一条都来自已发表文献里的真实错误。在设计阶段就拦截:

  • 数据泄漏:训练集与验证集污染、特征选择在全量数据上做等经典错误(scikit-learn 官方也把它列为第一类 pitfall
  • 统计假象:离群样本支撑的相关性、多重比较未校正、统计单元错配
  • 结论过度宣称:证据只到 L1 却写因果语言——审稿人最常见的拒稿理由之一
  • 可预见的审稿人质疑:413 条审稿人视角模式,提前把质疑写进设计的防守方案

配套的领域感知迁移机制会标注每条经验的四级适用范围与疾病领域距离:生殖领域的免疫浸润经验不能直接搬到心血管——方法层面可迁移,生物学层面不行;距离过大时自动追加跨域迁移提醒。知识时效性管理则按“学策略,验论断”原则工作:过时的科学论断标注而非删除,因为附着其上的策略经验依然有效;/bio-design refresh 会搜索最新证据,检查时效敏感论断是否仍然成立。

06

用 bio-design 和直接问 AI “帮我设计个课题”有什么区别?

维度bio-design直接问通用 AI
数据集可行性实时联网验证 GEO/GWAS/PDB 是否存在且可用,带来源呈现可能编造不存在的数据集 ID
经验来源382 个真实案例 + 6,235 条结构化模式,标注适用边界训练语料的模糊印象,无适用范围标注
结论措辞措辞天花板把用词锁在证据强度内,对齐 ICMJE 与报告规范要求倾向于迎合性地支持用户的预设结论
陷阱拦截546 条来自真实论文错误的 TRAP 在设计期拦截无系统性陷阱库
产出物机器可读 TOPIC.yml + 含应急预案的 design.md,可直接执行一段无法直接执行的文字建议
中途修正带版本号的在线修正:显式升版、重算受影响推理链反复打补丁,前后矛盾难以追溯

数据核验日期:2026-08-11,依据 bio-design 知识库实测。

07

如何使用 bio-design?

主入口只有一个命令,系统会自动路由到对应工作流:

/bio-design                          # 主入口,自动路由
/bio-design 我想用公共 GEO 数据研究心肌缺血中的铁死亡   # 分析设计
/bio-design scan papers/             # 批量预筛整个目录
/bio-design continue                 # 断点续接上次课题
/bio-design review Phase_output/     # 执行后复盘,驱动设计迭代
/bio-design refresh                  # 知识时效性检查
/bio-design depth beginner           # 三档指导深度:beginner / working / expert
  • 自然语言触发:提到“拆解文献 / 分析思路 / 生信设计 / 帮我设计 / 这篇文章怎么做的”时自动激活。
  • 三档指导深度:beginner(湿实验/临床出身,全程白话解释为什么)/ working(默认)/ expert(极简)。深度只调节解释详略,绝不削减安全检查。
  • 使用建议:先拆 1–2 篇参考文献再设计;诚实交代约束;相信措辞校准;重点看 TRAP 警告。
  • 环境要求:在 cc-bioinfo 平台上用什么都不需要装,浏览器打开即可;独立使用需 Claude Code CLI 与 Python 3.10+,无需 GPU。
08

常见问题 FAQ

cc-bioinfo、bio-design 和 bio-analyze 是什么关系?

三者是一个平台加两个内置引擎的关系。cc-bioinfo 是平台,回答“在哪里跑”;bio-design 是设计引擎,回答“做什么课题”;bio-analyze 是执行引擎,回答“怎么把它跑出来”。一句话:cc-bioinfo 是舞台,bio-design 是编剧,bio-analyze 是导演和全体演员。

我是临床医生,不会编程也不懂统计,能用吗?

能。它要求你提供的不是代码能力,而是临床判断:你的病人群体是什么、你真正想回答的问题是什么、哪个结局对病人有意义。设计对话全程用中文,把指导深度设为 beginner 后每个方法学选择都会用白话说清楚为什么。真实案例中临床角色提出的“门诊病人更关心能不能爬楼买菜”这类判断,最终成为了论文的核心卖点。

我要花多少时间,最后拿到什么?

一次完整的设计对话通常占用 1 到 2 小时,你的任务是在关键决策点回答问题。产出是两份文件:design.md 是能直接给导师或科室看的完整方案书,包含研究命题、证据链、图表计划、数据采集清单、可达与不可达结论、应急预案;TOPIC.yml 是机器可读的契约,直接交给 bio-analyze 执行。

bio-design 会替我做决定吗?

不会。核心交互模式是 AI 提出关键问题→你思考并回答→AI 据此推进下一步,在每个关键决策点暂停等待用户。即使显式要求全自动模式,六项安全检查(约束画像、案例匹配、陷阱扫描、措辞天花板校准、数据适配性验证、文献熟悉度检查)也不可省略。

为什么它不让我用 demonstrate 这样的词?

这是措辞天花板机制:每个证据等级对应一句结论天花板,L1 观察性证据只能说“X 与 Y 相关”,L4 因果证据才能说“X 因果影响 Y”。系统说“用 suggest 别用 demonstrate”时,它在保护你不被拒稿。

文献拆解支持哪些文件格式?拿不到全文怎么办?

支持 PDF、TXT、Markdown、DOCX、DOC、RTF、HTML 与 URL。只有标题或 DOI 时自动转入 Pre-SCAN 模式:基于摘要页做知识重建,按置信度分层标注、明确划出“我不知道”的边界。

我想先试试,从哪里开始?

邮件联系 moogtang@gmail.com 获取试用。用起来不复杂:在浏览器里直接输入 /bio-design 加一句话描述你的想法即可,不需要安装任何软件、不需要配环境、不需要先准备数据。建议的第一步是丢一篇你领域的参考文献进去让它拆解,你会直接看到它把那篇论文的分析思路拆成了什么。