这两天小编读到一篇NC论文上使用了这个软件进行真核生物的分箱于是想分享一下什么是VEBA病毒真核细菌古菌VEBA开源软件套件的开发以表征微生物的所有结构域为主要目标非事后调整包括原核生物、真核生物和病毒生物。VEBA是一款端到端宏基因组学和生物探测软件套件能够直接恢复和分析真核生物和病毒基因组以及原生支持候选门辐射CPR的原核基因组。VEBA实现了一种新的迭代分组程序和可选的混合样本特异性/多样本框架能够恢复比非迭代方法更多的基因组。为了优化微真核基因调用和分类VEBA包含了一个共识微真核数据库包含从多个现有数据库汇编的原生生物和真菌。VEBA还提供了一种独特的基于聚类的去复制策略允许样本特异性基因组和蛋白质直接在不重叠的生物样本间进行比较。VEBA还自动化了生物合成基因簇的识别和新颖评分用于生物勘探。VEBA的使命是使稳健的宏基因组学/转录组学分析变得轻松。VEBA的理念是工作流程应当模块化、可通用且易于使用中间步骤最少。VEBA实现的方法是尝试提前思考两步自动完成任务。安装因为它依赖众多所以增加了许多难度可能会有各种各样的报错没办法这就是开源软件的弊端啦当然最好的方案在这时候可能就变成了docker/singularity等容器啦。容器是分开的如果真分析真核应该直接用这个就可以docker pull jolespin/veba_binning-eukaryotic:2.5.2。# .condarc的设置推荐可选 channel_priority: flexible channels: - conda-forge - bioconda - jolespin - defaults report_errors: true # 初始化 conda init bash # 清理你的环境 conda clean --all -y # 更新你的 .conda conda update -n base --all -y # 安装并更新Mamba conda install -c conda-forge mamba -y conda update mamba -y # 下载repo # For stable version, download and decompress the tarball: Please double check this is the most recent version as displayed in **Releases** on GitHub. VERSION2.5.2 # wget https://github.com/jolespin/veba/archive/refs/tags/v${VERSION}.tar.gz # The .tar.gz is out of date in this release # tar -xvf v${VERSION}.tar.gz mv veba-${VERSION} veba # Alternative download wget https://github.com/jolespin/veba/releases/download/v${VERSION}/v${VERSION}.zip unzip -d veba v${VERSION}.zip # For developmental version, clone the repository: # Note: This is not recommended because between v2.1.0 and ≥v2.2.0, case changes were introduced (KOFAM - KOfam) # and these changes are not updating on GitHub. Please use official releases instead of pulling the repo: # git clone --branch devel https://github.com/jolespin/veba.git # Update the permissions chmod 775 veba/bin/*.py chmod 775 veba/bin/scripts/* chmod 775 veba/install/*.sh # Go into the install directory cd veba/install # 安装VEBA环境 4小时16GB内存 bash install.sh # 激活数据库conda环境下载并配置数据库 48 GB RAM conda activate VEBA-database_env bash download_databases.sh /path/to/veba_database/ bash check_installation.sh使用VEBA 是一个综合性的元基因组分析流程包含以下主要模块核心分析流程阶段模块功能数据预处理preprocess.py短读 Fastq 质量修剪、接头移除、污染去除preprocess-long.py长读Nanopore/PacBio质量处理组装assembly.py短读组装SPAdes/MEGAHITassembly-long.py长读组装Flye/MetaFlye覆盖度分析coverage.py短读比对计算覆盖度coverage-long.py长读比对计算覆盖度分箱Binning- 基因组恢复模块功能binning-prokaryotic.py迭代共识分箱恢复原核生物基因组MaxBin2/MetaBat2/CONCOCTbinning-eukaryotic.py真核生物分箱含 MetaEuk 外显子识别、BUSCO 质量评估binning-viral.py病毒基因组检测geNomad/VirFinder CheckV分类学注释模块功能classify-prokaryotic.py原核生物分类GTDB-Tkclassify-eukaryotic.py真核生物分类MetaEuk BUSCOclassify-viral.py病毒分类geNomad taxonomy功能注释与分析模块功能cluster.py物种水平基因组聚类 直系群检测FastANI/Skani MMseqs2annotate.py蛋白注释UniRef/Pfam/KOFAM/KEGG/VFDB/MiBIG/AMRFinderphylogeny.py系统发育树构建marker HMM MUSCLE FastTree/IQTreebiosynthetic.py生物合成基因簇检测antiSMASH比对与丰度分析模块功能index.py构建本地/全局 Bowtie2 索引mapping.py短读比对 定量Bowtie2 featureCountsprofile-taxonomy.py分类学谱分析Sylphprofile-pathway.py代谢通路谱分析HUMAnN实验性模块开发中模块功能amplicon.py扩增子分析QIIME2/DADA2crispr.pyCRISPR-Cas 系统检测一个典型工作流程是这样的原始数据 ↓ 预处理 (preprocess/preprocess-long) ↓ 组装 (assembly/assembly-long) ↓ 覆盖度计算 (coverage/coverage-long) ↓ 分箱恢复 MAG (binning-*) ↓ 分类注释 (classify-*) ↓ 聚类整合 (cluster) ↓ 功能注释 (annotate) ↓ 系统发育 分析 (phylogeny, profile-*, biosynthetic)# conda source activate VEBA veba --module preprocess --params {PARAMS} # singulrity/docker source activate VEBA-preprocess_env preprocess.py {PARAMS} # source activate VEBA veba --module assembly --params \-1 ${R1} -2 ${R2} -n ${ID} -o ${OUT_DIR} -p ${N_JOBS} -P metaspades.输出VEBA 基于 GenoPype 架构构建创建了可重复且易于导航的目录结构。GenoPype的理念是所有文件使用相同名称但以示例名称作为子目录。这样更容易整合文件进行 grepping、串接等。NextFlow 支持正在开发中。欢迎交流沟通你的使用经验呀有没有什么坑。参考10.1093/NAR/GKAE528 PMID3890929310.1186/S12859-022-04973-8