TarBio - Software de Análisis de Pureza Genética
Aplicación de escritorio para calcular similitud genética y pureza de muestras de laboratorio contra bases de datos genotipo × marcador. Incluye visualización de mapa de calor y exportación Excel/JSON.
SOFTWARE DE IDENTIFICACIÓN DE GENOTIPO Y PUREZA
Resumen
El Software de Identificación de Genotipo y Pureza (Software TarBio de Pureza Genética) es una solución de aplicación de escritorio desarrollada para calcular la similitud genética y la pureza de muestras de laboratorio contra bases de datos de genotipo × marcador. El software permite la comparación de muestras con genotipos de referencia, la detección de grupos de similitud entre genotipos y la generación de matrices de similitud por pares (mapas de calor). Los resultados se presentan tanto numérica como visualmente (gráficos/mapas de calor); también pueden exportarse a Excel/JSON.
Palabras clave: genotipo, marcador, análisis de pureza, análisis de similitud, huella digital, mapa de calor
1. Introducción
La verificación de la variedad y la determinación de la pureza genética en material vegetal/organismo es críticamente importante en la producción de semillas, estudios de mejoramiento y control de calidad. Este software automatiza la comparación de datos de marcadores obtenidos en el laboratorio (por ejemplo, SSR/STR, etc.) con genotipos de referencia predefinidos, produciendo resultados rápidos y reproducibles.
2. Objetivos y Requisitos del Software
- Creación y edición de bases de datos de genotipo × marcador
- Capacidad de almacenar tantos marcadores y genotipos como sea necesario (arquitectura escalable)
- Ingreso de nuevos datos de muestra y comparación automática de cada muestra con todos los genotipos de referencia
- Cálculo del porcentaje de coincidencia; también agrupación de genotipos completamente coincidentes
- Generación de matrices de similitud por pares y creación de mapas de calor
- Importación/exportación de datos en formato Excel/JSON
- Interfaz amigable: los nombres de genotipos, nombres de marcadores y valores de marcadores deben ser fácilmente editables
3. Metodología (Algoritmos)
3.1. A — Análisis de Pureza de Variedad
- Entrada: una muestra y genotipos de referencia (lista de genotipos) en la base de datos
- Método: Se seleccionan los marcadores no nulos (presentes) en la muestra. Para cada genotipo de referencia, se realiza la comparación con valores de marcadores en los mismos índices. Se cuenta el número de marcadores coincidentes. Porcentaje de coincidencia = (marcadores_coincidentes / marcadores_totales_comparados) × 100. Los resultados se ordenan de mayor a menor porcentaje de coincidencia.
- Nota: Si no hay marcadores válidos en la muestra para comparar, el análisis no puede realizarse.
3.2. B — Análisis de Similitud entre Variedades
- Entrada: lista de todos los genotipos
- Método (Técnica de Huella Digital): Los valores de marcadores de cada genotipo se convierten a una cadena (los valores nulos se representan con 'N'). Los genotipos con exactamente la misma cadena se agrupan — esto proporciona grupos con 100% de similitud. De los grupos resultantes, el grupo más grande similar y otros grupos similares se separan de los genotipos únicos (singulares).
- Además, se puede generar una matriz calculando el porcentaje de similitud sobre los marcadores comunes llenos entre cada par de genotipos (para el mapa de calor).
3.3. Matriz de Similitud por Pares
- Para cada par de genotipos, solo se comparan los marcadores que están llenos en ambos genotipos. Se calcula la proporción de marcadores coincidentes al número de marcadores comúnmente comparables y se convierte a porcentaje. Si no hay marcadores comunes llenos, se asume que la similitud es 0. La salida puede usarse como lista de similitud por pares o matriz NxN.
4. Interfaz y Flujo de Trabajo (Escenario de Uso)
- Pantalla de inicio: Nombre del software, descripción breve, carga de fuente de datos (Excel/JSON), selección de tipo de análisis
- Gestión de base de datos: El número de genotipos, nombres de genotipos, número de marcadores, nombres de marcadores y valores de marcadores para cada genotipo son editables. La adición/eliminación de marcadores y genotipos debe ser dinámica.
- Gestión de muestras: Se pueden agregar múltiples muestras, cada una ajustada según el número de marcadores en la base de datos.
- Selección de análisis: "Pureza de Variedad" o "Similitud de Variedad"
- Resultados:
- Pureza: Porcentajes de coincidencia ordenados por genotipos de referencia para cada muestra
- Similitud: Grupos exactamente coincidentes (grupos de huella digital), grupo más grande, genotipos únicos
- Mapa de calor: Visualización creada usando similitud por pares
- Exportación: Excel (estructura de tabla apropiada) y JSON. El soporte de informes PDF es opcional.
5. Protocolo de Validación y Pruebas
- Pruebas unitarias:
- Análisis de Pureza: muestra con algunos marcadores nulos vs. referencias completamente llenas. Comparación con porcentajes esperados.
- Análisis de Similitud: conjuntos de genotipos exactamente coincidentes y parcialmente coincidentes.
- Pruebas de integración: Prueba del flujo de carga de datos vía UI -> ejecutar análisis -> exportar.
- Validación con datos reales: Los resultados de muestras del laboratorio deben compararse con referencias conocidas.
6. Resultados y Discusión
El software acelera los análisis rutinarios como la verificación de genotipos y la evaluación de pureza mientras reduce el error humano. Analizar solo marcadores comunes llenos para muestras con datos parciales proporciona métricas confiables incluso en situaciones de datos faltantes. El método de huella digital es un enfoque simple y poderoso para la detección de coincidencias exactas; sin embargo, pueden necesitarse estadísticas adicionales (por ejemplo, pesos específicos, umbrales de puntuación de similitud) para interpretar similitudes parciales.
7. Mejoras Futuras
- Puntuación más avanzada para coincidencias parciales (por ejemplo, similitud de Jaccard, ponderación de similitud)
- Informes de intervalos de confianza estadísticos y tolerancia al error
- Análisis por lotes de múltiples muestras e integración de clustering (jerárquico/k-means)
- Automatización de informes e integración de sistemas de gestión de información de laboratorio (LIMS)
8. Guía de Usuario de la Aplicación (Breve)
- Crear base de datos: Determinar el número de genotipos y marcadores; ingresar nombres de genotipos y nombres de marcadores; agregar valores de marcadores para cada genotipo.
- Agregar muestras: Agregar tantas filas como el número de muestras e ingresar valores de marcadores.
- Seleccionar análisis: "Pureza" o "Similitud". Cuando se selecciona "Pureza", se hace comparación con referencias para cada muestra. Cuando se selecciona "Similitud", los genotipos se separan en grupos exactamente coincidentes y/o se calcula la similitud por pares.
- Revisar resultados, ver en formato de gráfico y tabla, exportar a Excel/JSON según sea necesario.