🧪 Metodología del pipeline bioinformático
El flujo de trabajo parte de la muestra biológica y termina en el perfil taxonómico y de expresión. Cada etapa fue validada sobre el clúster K3s del instituto, con la bioinformática ejecutándose de forma bare-metal mediante Conda.
-
Extracción de ADN de muestras de coral
Procesado del tejido coralino (gorgonias) y purificación de ADN genómico. Se obtuvieron 8 muestras (ADN01–ADN08) que cubren los dos géneros objetivo: Leptogorgia y Eunicella.
-
Secuenciación (formato FASTQ)
Las librerías se secuenciaron y cada muestra quedó representada por lecturas en formato FASTQ, almacenadas en almacenamiento NFS para su procesado posterior.
-
Filtrado de contaminantes (bbduk)
Eliminación de adaptadores, secuencias de baja calidad y contaminación humana con bbduk. Este paso reduce el ruido antes de la clasificación y el alineamiento.
-
Clasificación taxonómica con Kraken2
Asignación de cada lectura a un taxón con kraken2 y una base de datos personalizada, identificando el hospedador dominante, simbiontes y contaminantes ambientales del holobionte.
-
Análisis de resultados
Interpretación de los perfiles taxonómicos, agrupación de las muestras en clusters biológicos y preparación de los datos para los análisis de expresión.
🛠️ Herramientas utilizadas
Conda
Gestión de entornos y dependencias bioinformáticas en la computación bare-metal.
Kraken2
Clasificador taxonómico de alta velocidad (v2.17.1) con base de datos personalizada.
bbduk
Filtrado de adaptadores y contaminantes sobre las lecturas FASTQ.
HISAT2
Alineamiento de lecturas contra genomas completos, con índices separados por cluster.
featureCounts
Conteo de lecturas por gen para los posteriores análisis de expresión diferencial.
🖥️ Infraestructura de cómputo
El proyecto se ejecuta sobre la infraestructura de cómputo del instituto, basada en Kubernetes ligero con almacenamiento compartido y un nodo de cálculo dedicado.
K3s Master + NFS
Nodo maestro del clúster, servicio VPN y servidor NFS con 6TB de almacenamiento para datos raw y resultados.
Computación bare-metal
Nodo worker de 32 cores / 96GB RAM. Aquí vive el entorno Conda con Kraken2, bbduk, HISAT2 y featureCounts.
Orquestación
Kubernetes ligero gestiona la infraestructura base (red e Ingress), mientras la bioinformática corre fuera de contenedores.
Almacenamiento compartido
Los datos crudos y resultados se exportan por NFS entre nodos, permitiendo el acceso compartido de alumnos y administración.
➡️ Siguientes etapas
Con los perfiles taxonómicos definidos, el pipeline continúa con el alineamiento HISAT2 contra los genomas de referencia de cada cluster y el conteo con featureCounts para el análisis de expresión diferencial. Véase el diagrama de flujo completo.