Qué eliminan los filtros
Genómica de célula única · Bioinformática · Calidad de datos · Informe metodológicoliteratura revisada por pares hasta ene 2026 · material del fabricante capturado el 26 ago 2026
Informe metodológico · cómo una célula se convierte en una columna
Los filtros que deciden lo que un experimento de célula única vio
Entre un secuenciador y una matriz de genes por células hay una cadena de filtros, y cada uno descarta algo distinto que no es una célula sana: un código de barras que solo era ruido de fondo, una célula que ya estaba muriendo, dos células que comparten una etiqueta y ARN que se escapó de una célula y se contó en otra. Cada filtro es un umbral, y un umbral es una afirmación sobre lo que no pudo haber sido una célula. El más usado de todos — descartar por encima de un 5% de contenido mitocondrial — se ha medido en 5,530,106 células, y no sobrevive a un cambio de tejido.
En cifras las que están medidas
- 13 / 44tejidos humanos en los que el valor por defecto del 5% mitocondrial falla al separar células sanas de las de baja calidad
- 5,530,106células, en 1,349 conjuntos de datos anotados, detrás de ese hallazgo
- 1.7%tasa de dobletes entre especies publicada para un kit combinatorio — un mínimo, no un total
- 3comparaciones revisadas por pares de las dos químicas — y tres veredictos distintos
Qué elimina cada filtro, y con qué firmeza se sabe primero la firmeza, luego la afirmación
| Firmeza | Qué | Quién lo dice |
|---|---|---|
| Confirmado | Cada filtro de la cadena tiene un método publicado detrás: EmptyDrops separa células del fondo; Scrublet, DoubletFinder y scDblFinder localizan dos células bajo una etiqueta; SoupX, DecontX y CellBender quitan el ARN contado en la célula equivocada | los propios artículos de método, de 2019 a 2023 |
| Confirmado | El valor por defecto del 5% mitocondrial no distingue células sanas de las de baja calidad en 13 de los 44 tejidos humanos examinados, un 29.5%. El contenido mitocondrial medio es significativamente mayor en tejido humano que en el de ratón, y la plataforma de secuenciación no explica la diferencia. En tejidos de ratón el mismo umbral funciona bien en general | Osorio y Cai, Bioinformatics, 2021, sobre 5,530,106 células en 1,349 conjuntos de datos |
| Confirmado | De nueve métodos de detección de dobletes evaluados sobre 16 conjuntos reales con dobletes anotados experimentalmente y 112 sintéticos, DoubletFinder obtuvo la mejor exactitud de detección y cxds la mayor eficiencia computacional | Xi y Li, Cell Systems, 2020 |
| Confirmado | En organoides cerebelosos, el código de barras combinatorio y la captura en gotas dieron diversidad celular y reproducibilidad técnica comparables — pero el brazo de gotas presentó más células estresadas, y el combinatorio menores fracciones de transcritos mitocondriales y de proteínas ribosómicas y mayor diversidad de biotipos génicos | Sarieva y colegas, iScience, enero de 2026 |
| Declarado por el fabricante | Tasas de dobletes inferiores al 3% incluso con 100,000 células, y del 1.7% para una versión del kit frente al 1.3% de la anterior, medidas mezclando líneas celulares humanas y de ratón a partes iguales y contando los transcriptomas que llevan ambos genomas | Suite de soporte y página de conjuntos de datos de Parse Biosciences, capturadas el 26 ago 2026 |
| Declarado por el fabricante | El ARN libre tendría que seguir el camino exacto de una célula a lo largo de cuatro rondas de codificación split-pool para asignarse mal — cifrado en 1 entre 3,538,944 — y un lavado retira las moléculas libres antes de la lisis. El ARN ambiental es peor que el dropout, porque el dropout pierde un gen mientras que el ambiental se lo da a la célula equivocada: un linfocito T CD8+ que se lee como si llevara CD4 | Suite de soporte de Parse Biosciences, capturada el 26 ago 2026; no se halló ninguna medición independiente de la cifra |
| Inferencia nuestra | Un gráfico de mezcla de especies no puede ver un doblete formado por dos células de la misma especie. Con una mezcla al 50% entre dos especies, aproximadamente la mitad de los dobletes son invisibles, y cualquier cifra publicada entre especies es un mínimo de la tasa real, no una estimación de ella. Vale para la cifra de cualquier fabricante, no la de uno solo | lectura de este proyecto, sobre la aritmética de Bloom, PeerJ, 2018 |
En qué orden
Cómo se construyó el instrumental solo publicaciones — las páginas de soporte del fabricante llevan tres fechas cada una y no se sitúan aquí
- 2016Ilicic y colegas plantean el problema general de clasificar células de baja calidad, con más de un 30% de mejora en exactitud frente a métodos tradicionales en más de 5,000 células — Genome Biology
- Mar 2018SPLiT-seq: la ligación split-pool etiqueta el ARN de cada célula por código de barras combinatorio, sin microfluídica ni equipos a medida. 156,049 núcleos, más de 100 tipos celulares — Science. Es el método tras la plataforma combinatoria de todas las comparaciones siguientes
- Sep 2018Bloom deduce cómo se relaciona la tasa observada de transcriptomas mixtos con la frecuencia real de multipletes, para tipos celulares mezclados en cualquier proporción — PeerJ
- Mar 2019EmptyDrops identifica células contrastando cada código de barras con el perfil de expresión ambiental, y conserva tipos celulares que los métodos anteriores descartaban — Genome Biology
- Apr 2019Scrublet y DoubletFinder aparecen en el mismo número de Cell Systems. Ambos construyen dobletes artificiales a partir de los propios datos y preguntan qué células reales quedan más cerca de ellos
- Jun 2019Luecken y Theis publican el primer tutorial de buenas prácticas de principio a fin del campo, del control de calidad al análisis posterior — Molecular Systems Biology
- 2020El problema del ARN ambiental recibe sus herramientas: DecontX en marzo, que estima la contaminación por célula como una mezcla bayesiana, y SoupX en diciembre, que la cuantifica y corrige los recuentos. Entre ambas, en diciembre, Xi y Li evalúan nueve detectores de dobletes
- 2021Osorio y Cai ponen a prueba el 5% mitocondrial por defecto en 5,530,106 células y publican en su lugar valores de referencia para 121 tejidos de ratón y 44 humanos — Bioinformatics, mayo. scDblFinder llega en septiembre
- 2023Heumos y colegas extienden las buenas prácticas a varias modalidades en Nature Reviews Genetics, marzo. CellBender llega en agosto y modela el ruido de fondo de las gotas como un proceso generativo, con un funcionamiento cercano al límite teórico óptimo de eliminación de ruido en datos simulados — Nature Methods
- 2024Las dos químicas se comparan cara a cara, dos veces, y discrepan. Xie y colegas sobre PBMC humanas en marzo — International Journal of Molecular Sciences; Filippov y colegas sobre timo de ratón en noviembre — BMC Genomics
- Jan 2026Sarieva y colegas los comparan por tercera vez, en organoides cerebelosos, y hallan que la propia señal de estrés difiere entre ambos flujos de trabajo — iScience. Es el hallazgo técnico más reciente de esta página
- Aug 2026Contexto comercial, y solo la versión de una parte: Parse Biosciences anuncia que el Tribunal de Apelaciones del Circuito Federal de Estados Unidos rechazó el recurso de 10x Genomics, confirmando la invalidación de las patentes esgrimidas contra ella. Aquí no se leyó la resolución del tribunal, y la propia nota discrepa consigo misma: fechada el 19 de agosto en el texto y el 20 de agosto en la firma. Afecta a quién puede vender qué; no afecta a ninguna de las mediciones anteriores
El argumento
Un umbral que no viaja qué dicen las mediciones, y qué no
La fracción mitocondrial es el caballo de batalla del control de calidad en célula única, y la lógica que la sostiene es buena: una célula estresada pierde transcritos citoplasmáticos por una membrana que falla, mientras que sus transcritos mitocondriales, encerrados en su propio orgánulo, se quedan. Así, la proporción mitocondrial de los recuentos de una célula sube conforme la célula muere, y toda célula por encima de cierta proporción se descarta. La proporción que usa casi todo el mundo es el 5%. Osorio y Cai señalan que la fijaron publicaciones tempranas, que se adoptó como valor por defecto en varios paquetes de análisis y que se asentó como estándar de hecho — y que su validez entre especies, tecnologías, tejidos y tipos celulares nunca se había evaluado como es debido. De modo que la evaluaron, sobre 5,530,106 células en 1,349 conjuntos de datos anotados. En tejido de ratón el umbral aguanta en general. En tejido humano no distingue células sanas de las de baja calidad en 13 de los 44 tejidos examinados, y el contenido mitocondrial medio es bastante mayor en humano que en ratón por razones que la plataforma de secuenciación no explica. Su respuesta no es una constante mejor, sino una tabla: valores de referencia para 121 tejidos de ratón y 44 humanos. Cinco años después, Sarieva y colegas vieron moverse de nuevo la misma métrica, esta vez con la química — el brazo de gotas de su comparación de organoides llevaba más células estresadas y mayores fracciones de transcritos mitocondriales y ribosómicos que el brazo combinatorio, sobre la misma biología. Un umbral que se desplaza con la especie, el tejido y el método de captura no es una propiedad de las células. Es una propiedad de un experimento, y se está escribiendo como si fuera de las células.
- 29.5%de los tejidos humanos probados — 13 de 44 — donde el valor por defecto del 5% no separa las células sanas de las de baja calidad
- 121 + 44tejidos, de ratón y humanos, para los que se publican valores de referencia en lugar de una cifra única
- 1,349conjuntos de datos anotados detrás del hallazgo, con 5,530,106 células
Lo que esto no dice
No dice que la cifra del 5% sea errónea. En tejidos de ratón sus autores informan de que funciona bien en general, y en muchos tejidos humanos también sirve. El hallazgo va de transferencia, no de la cifra: un valor por defecto trasladado sin cambios desde el tejido en que se dedujo a un tejido que nadie comprobó.
Lo que sí dice
Un filtro no es maquinaria neutral. Cada célula que retira es una célula que el experimento ya no puede haber visto, y en casi un tercio de los tejidos humanos probados el filtro más común no distingue una célula moribunda de una rica en mitocondrias. Los autores lo dicen sin rodeos: omitir el filtro, o adoptar un umbral subóptimo, puede llevar a interpretaciones biológicas erróneas.
Lo que aportan los demás
Cuatro cosas que aporta el resto de la literatura química, dobletes, ARN ambiental, escala
Química
Tres comparaciones, tres veredictos
- PBMC humanas, dos donantes — frecuencias de tipos celulares comparables. El código de barras combinatorio capturó menos células pero detectó tipos raros, entre ellos plasmablastos y células dendríticas, gracias a una mayor sensibilidad de detección génica. La longitud génica y el contenido de GC se distribuyeron distinto entre plataformas (Xie, 2024)
- Timo de ratón — el código de barras combinatorio detectó casi el doble de genes, y cada plataforma detectó un conjunto distinto. Pero los datos de gotas tuvieron menor variabilidad técnica y una anotación más precisa de los estados biológicos (Filippov, 2024)
- Organoides cerebelosos — diversidad y reproducibilidad comparables, pero más células estresadas en el brazo de gotas y menores fracciones mitocondrial y ribosómica en el combinatorio (Sarieva, 2026)
Dobletes
Nadie coincide en qué detector usar
- Xi y Li evaluaron nueve métodos y situaron a DoubletFinder primero en exactitud de detección y a cxds primero en eficiencia computacional (2020)
- El artículo de scDblFinder afirma que un banco de pruebas independiente ya lo había situado por delante de las alternativas (2021). Es otro banco de pruebas, y no una repetición del primero
- Sea cual sea el detector, el parámetro de entrada que suele pedir es una tasa esperada de dobletes — y las cifras disponibles para eso vienen de mezclas de especies, que no pueden ver un doblete de la misma especie
ARN ambiental
El instrumental tiene forma de gota
- SoupX, DecontX y CellBender se describen a sí mismos como métodos de gotas en sus propios resúmenes. El modelo de CellBender razona explícitamente sobre la diferencia entre gotas con célula y gotas vacías
- El ARN ambiental es peor que el dropout, y la razón conviene retenerla: el dropout pierde un gen, mientras que el ambiental se lo entrega a la célula equivocada — un linfocito T CD8+ que se lee como si además llevara CD4
- Un flujo de trabajo sin gotas no tiene gotas vacías que modelar. Parse Biosciences cifra sus propias probabilidades de mala asignación en 1 entre 3,538,944 a lo largo de cuatro rondas de codificación, más un lavado antes de la lisis — cifra del fabricante, aritméticamente consistente, y que nadie más ha repetido
Escala
Qué dice de verdad la guía publicada
- Profundidad mínima de secuenciación publicada para una plataforma combinatoria: 20,000 lecturas por célula para las versiones 2 y 3 del kit, y 10,000 para la versión 4 por su mayor eficiencia de biblioteca. Más profundidad para tipos raros en una población heterogénea; menos es defendible en una homogénea
- Un tutorial publicado de un millón de células, sobre sangre periférica de 24 donantes, especifica una instancia en la nube de al menos 8 hilos y 160 GB de RAM
- La anotación automática de tipos celulares, allí donde una plataforma comercial la ofrece, son ScType, Decoupler y CellTypist; el agrupamiento es Leiden o Louvain. Nada de eso es propietario, y elegir cuál es un juicio que la plataforma te devuelve
Y entonces qué
Cinco cosas que llevarse de aquí y una pregunta que nadie ha zanjado
- Contrasta el umbral mitocondrial con tu tejido, no con el valor por defecto. Ya existen valores de referencia para 121 tejidos de ratón y 44 humanos, y en 13 de esos 44 la cifra del 5% no hace su trabajo.
- Lee una cifra de dobletes por mezcla de especies como un mínimo. Muestre lo que muestre el gráfico, la mitad de dobletes de la misma especie nunca estuvo ahí — y esa cifra suele ser justo la que tu detector de dobletes te pide introducir.
- No leas las comparaciones de plataformas como un marcador. Tres estudios revisados por pares, tres tejidos, tres respuestas distintas. Quédate con el que se parezca a tu tejido y a tu criterio, y toma los otros dos como prueba de que la cuestión sigue abierta.
- Pregúntate si tu herramienta de ARN ambiental se hizo para tu química. Las tres más comunes dicen gota en sus propios resúmenes. Eso no prueba que fallen en otro sitio; es un motivo para averiguarlo antes de fiarte de los recuentos corregidos.
- Trata una cifra del fabricante como lo que es. Cualquiera de las de esta página puede ser cierta. Ninguna se ha repetido de forma independiente, y cada una es una medición que una empresa hizo de su propio producto.
Sigue abierto
Qué detector de dobletes usar. Un banco de pruebas de nueve métodos situó a DoubletFinder primero en exactitud; el artículo de scDblFinder cita otro banco independiente que lo pone a él por delante. Ambos están publicados, aquí no se ha vuelto a ejecutar ninguno frente al otro, y esta página no elige entre ellos.
En resumen
Cada paso de esta cadena es un umbral, y un umbral es una afirmación sobre lo que no pudo haber sido una célula. El más usado del campo es demostrablemente específico de tejido y sensible a la plataforma, y se escribe como una constante. No es un fallo de la métrica. Es un fallo en arrastrar consigo sus condiciones — y esas condiciones llevan publicadas desde 2021, tejido por tejido.