数据存档与共享

原始测序数据、基因组组装和论文关联代码优先进入对应专业库或通用仓库。

  • GSA 宏基因组、扩增子、转录组等原始测序数据及其 BioProject、BioSample 元数据。
  • SRA / ENA 国际原始序列数据归档和公共数据检索;同一数据不必重复提交多个 INSDC 节点。
  • GWH 分离菌、MAG 等基因组组装、注释及关联元数据。
  • Zenodo 绘图数据、脚本、补充文件和软件版本存档,可获得 DOI。

微生物注释与功能检索

分类和功能判断必须同时记录参考库版本、下载日期和关键参数。

  • SILVA 细菌、古菌和真核生物 rRNA 分类与比对;适用于 16S 扩增子和分类器构建。
  • UNITE 真菌 ITS 分类和 Species Hypothesis 参考库。
  • GTDB 基于基因组系统发育的细菌和古菌分类;用于分离菌与 MAG 分类。
  • eggNOG / KEGG 蛋白正交群、功能类别、代谢通路和模块的交叉注释。

环境与生态公开数据

用于研究区背景、生态观测和论文关联环境数据的检索与发布。

  • 国家地球系统科学数据中心 中国气候、土壤、土地利用、地理空间与生态环境基础数据。
  • PANGAEA 地球化学、沉积物、海洋和环境数据的长期发布与引用。
  • GBIF 全球物种分布、标本和观测记录;下载时应保存 DOI 和筛选条件。

分析环境与可重复工作流

分析应可复跑,而不只保留软件名称或一次性操作记录。

  • QIIME 2 扩增子分析、可视化和分析溯源;记录引物、去噪、过滤和分类器参数。
  • fastp / MultiQC 原始序列质控与汇总报告,适合固定为测序分析的第一步。
  • R / Python 统计、绘图、自动化处理和模型分析;正式结果应保留脚本与包版本。
  • Conda、容器与工作流 以环境文件、镜像和 Snakemake / Nextflow 固定复杂分析的依赖与步骤。

最低数据规范

  • 项目启动时建立唯一项目和样品编号,并在采样、送样前完成元数据表。
  • 原始数据进入只读目录;从副本开始处理,不直接覆盖仪器文件、FASTQ、原始图像或光谱。
  • 记录数据来源、软件和数据库版本、参数、运行日期,以及样品筛除理由。
  • 正式图表保留源数据、生成脚本和说明;统计结果不只报告 P 值。
  • 重要数据按 3-2-1 原则备份;投稿前完成专业库提交、登录号登记和公开时间设置。