cc-bioinfo_
EN

Chat Code for Bioinformatics · v0.1.0

对话即分析。
从一句话的科研想法,到可投稿的论文初稿。

cc-bioinfo 把大语言模型的推理能力与专业生信计算环境结合在一个多用户平台里:你说清楚科学问题,AI 负责设计、建环境、编码、执行、出图、写稿——每一步都留痕、可审计、可复现。

查看个人版 / 企业版 无需安装 · 无需配环境 · 浏览器直接访问

90 秒看懂 cc-bioinfo · 从提问到出稿的完整流程

cc-bioinfo 是什么?

形态上,它是一套装在 Linux 服务器上、通过浏览器访问的多用户分析环境——就像 RStudio Server,只是你不写代码,改成用中文对话。本机什么都不用装,打开浏览器就能用;分析跑在服务器上,关掉浏览器也不中断。

cc-bioinfo(Chat Code for Bioinformatics)是一个多用户、私有化部署的 AI 原生生物信息学分析平台:科研人员用自然语言描述分析意图,平台自动生成并执行 R/Python 代码,产出可复现的生信分析工作流与可投稿的论文初稿。它内置两个引擎:bio-design 负责课题设计,bio-analyze 负责分析执行。

  • 服务端 Ubuntu 24.04+ LTS;客户端任意现代浏览器,无需安装
  • v0.1.0(2026-07-09 发布)— 首个正式版本,多用户服务器架构 + 双引擎流水线实战验证
  • 6 个独立完成的真实科研课题端到端验证,含如实报告的阴性结果
  • 100+ 预装科研 Agent 技能(v0.1.0 实测 153 个安装验证),4 个插件市场
  • 4 条 IM 渠道(微信、钉钉、飞书、Telegram)全部端到端测试通过
个人版同样是这套 Linux 环境,只不过通过 WSL 跑在你自己的 Windows 电脑上,访问方式一样是浏览器。
cc-bioinfo 浏览器界面截图:左栏是按项目分组的会话列表,中栏是服务商、权限、IM 接入、MCP、技能等设置项,右侧是内嵌的宿主机终端
浏览器里的实际界面 · 左栏按项目组织的会话、中栏设置、右侧内嵌宿主机 Shell。整套 Linux 环境跑在服务器上,你这边只有一个浏览器标签页
01

怎么获取?个人版与企业版如何购买?

先免费试,觉得合适再买。四条通道对应四种不同的情况:

你的情况怎么做说明
想先看看好不好用邮件 moogtang@gmail.com 申请试用无需安装、无需配环境、不用先准备数据
个人版(单一研究者)邮件至 moogtang@gmail.com 咨询报价一个人用,装在自己机器上,数据不出本机
中国大陆个人用户通过小红书直接下单无需跨境支付,顺便可以关注账号看真实分析踩坑记录
企业版(科室 / 实验室 / 机构)邮件至 moogtang@gmail.com 咨询报价含私有化部署、多用户隔离、机构账号认证与部署支持

两种版本均为咨询报价,无公开价格表。

个人版适合谁

  • 自己一个人做课题,不需要多人共用
  • 数据敏感,希望完全留在自己机器上
  • 不想、也不需要另配一台服务器
  • 机器配置跟得上:16 GB 内存能用,32 GB 更稳——分析全在本地跑
  • 安装与配置全程有视频:个人版部署指南

企业版适合谁

  • 科室、实验室、医院与高校的共享分析平台
  • 需要每个成员数据互相隔离,但共享一套算力与模型资源
  • 因合规或 IT 管控要求部署在自有服务器上

平台的产品介绍与公开文档可在 cc-bioinfo 公开仓库查看(README、更新日志、功能说明);部署包与安装支持在购买后提供。

邮件咨询报价 中国大陆个人用户可直接走小红书
02

cc-bioinfo 与聊天机器人有什么本质区别?

cc-bioinfo 不是大模型聊天套壳,而是一个类似 RStudio Server + CWL 工作流层的全功能交互式计算环境。生物学家、临床医生和数据科学家用自然语言与数据“对话”,平台将意图转化为 R 或 Python 代码,在底层持久化计算环境中直接执行、调试。

它是服务器端多用户平台,部署在科研院所和医院自有基础设施内。科研人员通过浏览器访问,本机无需安装任何软件;关闭浏览器后,运行中的分析任务、定时任务与 IM 消息收发均不中断——数小时的全流程分析可以无人值守完成。

153个科研技能
v0.1.0 安装验证
6+1条组学流水线
scRNA / 空间 / Bulk / 蛋白 / 代谢 / 脂质 + ATAC
17 项安装后自检
关键文件 · 服务状态 · 配置
200 MB流式文件传输上限
nginx 缓冲优化
03

核心功能有哪些?

  • 对话驱动代码“帮我用 DESeq2 做差异表达分析”——系统自动编写代码、安装缺失依赖、准备运行环境;报错一键交给 AI 诊断堆栈并给出修复代码。
  • 零环境配置自动为每个项目建独立 Conda 环境、缺包即装,连 Conda 都没有时从零自举 Miniconda——环境地狱这一关不用你过。
  • bio-design 课题设计上游设计引擎:文献拆解 + 启发式设计对话,382 个已拆解案例、6,235 条决策模式支撑。
  • bio-analyze 自主执行下游执行引擎:Step 0–7 全流程,无人值守完成数小时分析,一直做到 SCI 稿件初稿。
  • 浏览器内置终端每用户独立 tmux 终端,装包、建环境、跑脚本都在网页里完成,不需要配 SSH 客户端
  • IM 多渠道接入微信、钉钉、Telegram、飞书四渠道端到端测试通过:权限审批、项目切换、流式结果卡片,出门诊间隙也能拍板。
  • 多模型生态原生深度集成 Claude API;统一路由无缝切换 OpenAI、Gemini、DeepSeek、Ollama;支持双 OAuth 通道,无需 API 密钥。
  • 沉浸式 IDE 体验完整 Web UI:左侧 AI 对话、右侧代码改动与 Diff 视图;多项目管理含会话历史与分支。
  • 插件生态Web UI 或 CLI 安装社区插件:PubMed 检索、scRNA-seq QC、Open Targets、Consensus 等。
  • 三层配置架构项目层 > 用户全局层 > 框架层;实验室特有 marker 基因表与内建知识合并而非替换。
04

多用户架构与数据安全如何设计?

cc-bioinfo 采用三层多用户架构:nginx 反向代理(含 Lua)→ Go 认证服务(Linux PAM + 会话 + 审计)→ 每用户独立的 Bun 进程(systemd 模板单元管理)。

  • 进程级隔离:每个用户会话以其自身 Linux UID 运行,配 PrivateTmp、内存限制与 CPU 配额。
  • Unix socket 路由:请求经每用户独立套接字路由,用户之间无法访问彼此会话;已通过双用户并发的真实跨用户隔离测试。
  • 机构账号认证:认证服务直接走 Linux PAM,用机构已有的用户名密码登录,无需另建账号体系。
  • 服务端常驻:用户进程由 systemd 管理,不依赖浏览器连接;系统重启后服务自动恢复。

数据合规口径:原始数据仅在服务器本地 R/Python 环境中读取;是否有数据出内网取决于管理员配置的 LLM 服务商。需要完全数据驻留时,可配置 Ollama 等私有化 LLM——平台本身不含“数据不出内网”的技术强制,这一点我们如实说明。

05

cc-bioinfo 与 RStudio Server、Jupyter、聊天机器人相比如何?

能力维度cc-bioinfoRStudio Server / Jupyter通用 AI 聊天机器人
交互方式自然语言对话驱动,代码自动生成并执行手写代码对话,但只能给建议、不能执行
环境配置自动建 Conda、缺包即装、无 Conda 自举需自行配置与维护不适用
课题设计bio-design 启发式设计 + 文献拆解无结构化流程,数据集 ID 可能编造
全流程覆盖设计 → 分析 → 图表 → SCI 稿件初稿 → 投稿包仅执行环境无执行环境
多用户隔离Linux UID 进程级隔离 + PAM 认证有(需自行运维)不适用
无人值守服务端常驻,关浏览器不中断,IM 远程控制会话依赖客户端不适用
质量治理预注册锁、数据真实性铁律、五维度质量审计依赖使用者自律

数据核验日期:2026-08-11,依据 cc-bioinfo v0.1.0 文档。

想看更细的对比——包括与通用 AI 技能库、在线分析平台、自己写脚本的逐项比较,以及不该用本平台的场景——见对比页

06

cc-bioinfo 适合谁?不适合谁?

适合

  • 需要发表 SCI 论文但不写代码的临床科研人员(首要目标用户)
  • 被环境配置卡住、不会用命令行的研究生与湿实验出身者
  • 需要共享 LLM 资源、又要保持用户数据隔离的科研院所 / 医院 / 高校平台
  • 受 IT 管控、无法在本机安装软件的科研人员
  • 想要“更聪明的 RStudio Server”的生信工程师与数据科学家

不适合

  • 每天数百样本的生产级测序中心流水线——请用 Nextflow / Snakemake
  • 底层算法与方法学开发——请直接编程
  • 纯上游分析(基因组组装、比对)——请用 BWA / GATK / SPAdes
  • 期望 AI 替代统计训练与科学判断的场景——关键节点仍需人的决策
07

如何开始使用?

  1. 第 1 步 · 先申请试用:邮件联系 moogtang@gmail.com。用起来就是浏览器里直接用中文对话,两个推荐的入口:丢一篇你领域的文献让 bio-design 拆解,或拿一份公开 GEO 数据让 bio-analyze 跑段质控与聚类。
  2. 第 2 步 · 选版本:个人自用选个人版,科室或机构选企业版,详见购买说明
  3. 第 3 步 · 部署与开通:个人版跟着个人版部署指南走即可,三段视频覆盖全过程;企业版在你们自有服务器上部署,安装向导会自动安装全部依赖、配置 TLS,并在完成后运行 17 项自检。部署包与安装支持在购买后提供。
环境要求企业版(服务器)个人版(自己的电脑)
操作系统Ubuntu 24.04+ LTSWindows + WSL2(导入 Linux 镜像)
CPU2 核起,推荐 4 核以上4 核以上
内存4 GB 起,推荐 8 GB 以上16 GB 起,推荐 32 GB
磁盘10 GB 起,推荐 20 GB 以上建议 300 GB

两列数字差距很大,是因为量的不是同一件事:企业版那栏只是平台本身的开销,真实分析跑在机构的算力上;个人版所有事都在你这台机器上完成——平台、Conda 环境、原始数据、分析计算全都在本地,所以要按跑得动单细胞、空间转录组来准备。部署指南里有镜像获取与安装的完整说明。

08

有哪些真实完成的研究案例?

以下 6 个课题在 cc-bioinfo 平台上端到端完成:由 AI 临床医生角色与 AI 生信科研者角色协作,人类只在开头说一句话。全部使用公开真实数据,含如实报告的阴性结果。完整过程档案见 真实案例 页。

  • 孟德尔随机化
    统计遗传学
    房颤 → 心衰的因果结构与蛋白中介基于 IEU OpenGWAS 汇总统计量,AF→HF OR 1.34(p=3×10⁻⁵⁹),1,915 个血浆蛋白全扫、中介交集为零——一句话指令产出 8,060 词英文投稿手稿。
  • 单细胞 + 空间
    心血管
    颈动脉斑块 SMC 稳定性五层证据闭环20,909 个 SMC 谱系细胞 + Xenium 120,164 细胞空间验证;数据不支持预设时,AI 把整篇论文的命题推翻重建。
  • 药物基因组学
    对比研究
    CAVD vs CAD 因果图谱对比与药物重定位300 靶点双结局 MR、26 小时 7 条并行证据线——用遗传学解释“他汀为什么治不好瓣膜钙化”。
  • 机制药理
    分子对接
    七氟醚 × 心肌缺血再灌注 × 铁死亡撞上预注册闸门后诚实换向:对接分数全部未过线,结论如实框定为“非单靶点抑制”。
  • 循证医学
    伞式综述
    HFpEF 药物治疗证据版图体检102 篇 Meta 分析:96.1% AMSTAR-2 评级 Critically Low,全语料重叠度 16.7%——“这个领域需要的不是更多 MA,而是更好的 MA”。
  • 生殖医学
    自主选题
    反复着床失败内膜受容窗口三轮连续研究AI 自己出题、三轮层层收缩、三次诚实关门——每一轮都关闭了一个被广泛假设成立的机制。
09

常见问题 FAQ

cc-bioinfo、bio-design 和 bio-analyze 是什么关系?

三者是一个平台加两个内置引擎的关系,不是三个平行产品。一句话记住:cc-bioinfo 是舞台,bio-design 是编剧,bio-analyze 是导演和全体演员。

名称它回答的问题你什么时候用它你拿到什么
cc-bioinfo在哪里跑?全程——它是承载另外两个的环境浏览器里的分析工作台、内置终端、多用户隔离、关浏览器不中断
bio-design做什么课题?开题前、拿到数据前design.md 方案书(能直接给导师看)+ TOPIC.yml 机器可读契约
bio-analyze怎么把它跑出来?设计定了、数据到手后分析结果、出版级图表、技术报告、SCI 稿件初稿

两个引擎可以单独用:只想把课题想清楚,只用 bio-design;已经有现成方案和数据,直接用 bio-analyze。串起来才是完整闭环:执行完成后用 /bio-design review 把结果反向映射回设计,产出修订版再喂回执行引擎——设计与执行互相校准,而不是一次性输出。

怎么购买?有哪些版本?

正式版本分两种:个人版面向单一研究者,企业版面向科室、实验室与机构,含私有化部署与多用户隔离。两种版本均为咨询报价,无公开价格表,请发邮件至 moogtang@gmail.com;中国大陆个人用户另可通过小红书直接下单。详见购买说明

使用 cc-bioinfo 需要会写代码吗?

不需要。研究者用自然语言描述分析意图,平台自动生成并执行 R/Python 代码,并自动搭建 Conda 环境。但关键科学判断(细胞类型注释确认、分析方向选择、图表审核)仍需研究者本人决策。

我不会配环境、不会用命令行,也能用吗?

能。环境配置是生信的第一道坑,也是大多数人真正倒下的地方。平台把终端做进了浏览器,无需配 SSH 客户端;更常见的用法是根本不碰终端——bio-analyze 自动为每个项目建独立 Conda 环境、缺包即装,连 Conda 都没有时从零自举 Miniconda。详见生信痛点 QA

数据会离开我们的服务器吗?

原始数据(h5/rds/FASTQ/BAM 等)仅在平台所在服务器的本地 R/Python 环境中读取。是否有数据出内网取决于管理员配置的 LLM 服务商;平台支持配置私有化 LLM 以实现完全数据驻留,但平台本身不含数据不出内网的技术强制。

和直接用 ChatGPT 或 Claude 聊天有什么区别?

聊天机器人只能给建议,不能执行。cc-bioinfo 是一个类似 RStudio Server 的持久化计算环境:AI 生成的代码直接在服务器上运行、报错自动诊断修复、结果落盘为可复现的工作流,关闭浏览器后分析仍在服务端继续。

AI 生成的分析结果可信吗?

平台以工程手段而非承诺来约束可信度:预注册判定规则先于结果写死、数据真实性铁律禁止模拟数据与捏造统计值、五维度质量审计在解读前强制拦截、结论措辞被锁定在证据强度之内。最终科学责任仍在研究者:稿件为初稿,需人工核实。

我想先试试,从哪里开始?

邮件联系 moogtang@gmail.com 获取试用。用起来就是浏览器里直接用中文对话,不需要安装软件、不需要配环境。两个推荐的第一步:丢一篇你领域的参考文献进去让 bio-design 拆解,或拿一份公开 GEO 数据让 bio-analyze 跑段质控与聚类。

cc-bioinfo 支持哪些组学类型?

内置六条标准化流水线:单细胞 RNA-seq、空间转录组、Bulk RNA-seq、蛋白质组、代谢组、脂质组;另有 ATAC-seq、WGCNA孟德尔随机化、分子动力学模拟评估等知识库覆盖。每条流水线定义强制步骤与强制图表清单,实时合规检查。