🧪 Metodología del pipeline bioinformático

El flujo de trabajo parte de la muestra biológica y termina en el perfil taxonómico y de expresión. Cada etapa fue validada sobre el clúster K3s del instituto, con la bioinformática ejecutándose de forma bare-metal mediante Conda.

  1. Extracción de ADN de muestras de coral

    Procesado del tejido coralino (gorgonias) y purificación de ADN genómico. Se obtuvieron 8 muestras (ADN01–ADN08) que cubren los dos géneros objetivo: Leptogorgia y Eunicella.

  2. Secuenciación (formato FASTQ)

    Las librerías se secuenciaron y cada muestra quedó representada por lecturas en formato FASTQ, almacenadas en almacenamiento NFS para su procesado posterior.

  3. Filtrado de contaminantes (bbduk)

    Eliminación de adaptadores, secuencias de baja calidad y contaminación humana con bbduk. Este paso reduce el ruido antes de la clasificación y el alineamiento.

  4. Clasificación taxonómica con Kraken2

    Asignación de cada lectura a un taxón con kraken2 y una base de datos personalizada, identificando el hospedador dominante, simbiontes y contaminantes ambientales del holobionte.

  5. Análisis de resultados

    Interpretación de los perfiles taxonómicos, agrupación de las muestras en clusters biológicos y preparación de los datos para los análisis de expresión.

🛠️ Herramientas utilizadas

🐍

Conda

Gestión de entornos y dependencias bioinformáticas en la computación bare-metal.

🧬

Kraken2

Clasificador taxonómico de alta velocidad (v2.17.1) con base de datos personalizada.

🧹

bbduk

Filtrado de adaptadores y contaminantes sobre las lecturas FASTQ.

🎯

HISAT2

Alineamiento de lecturas contra genomas completos, con índices separados por cluster.

📈

featureCounts

Conteo de lecturas por gen para los posteriores análisis de expresión diferencial.

🖥️ Infraestructura de cómputo

El proyecto se ejecuta sobre la infraestructura de cómputo del instituto, basada en Kubernetes ligero con almacenamiento compartido y un nodo de cálculo dedicado.

kubersierra

K3s Master + NFS

Nodo maestro del clúster, servicio VPN y servidor NFS con 6TB de almacenamiento para datos raw y resultados.

la-bestia

Computación bare-metal

Nodo worker de 32 cores / 96GB RAM. Aquí vive el entorno Conda con Kraken2, bbduk, HISAT2 y featureCounts.

K3s

Orquestación

Kubernetes ligero gestiona la infraestructura base (red e Ingress), mientras la bioinformática corre fuera de contenedores.

NFS

Almacenamiento compartido

Los datos crudos y resultados se exportan por NFS entre nodos, permitiendo el acceso compartido de alumnos y administración.

➡️ Siguientes etapas

Con los perfiles taxonómicos definidos, el pipeline continúa con el alineamiento HISAT2 contra los genomas de referencia de cada cluster y el conteo con featureCounts para el análisis de expresión diferencial. Véase el diagrama de flujo completo.