Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.81.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Genómica de célula única · Bioinformática · Calidad de datos · Informe metodológicoliteratura revisada por pares hasta ene 2026 · material del fabricante capturado el 26 ago 2026

Informe metodológico · cómo una célula se convierte en una columna

Los filtros que deciden lo que un experimento de célula única vio

Entre un secuenciador y una matriz de genes por células hay una cadena de filtros, y cada uno descarta algo distinto que no es una célula sana: un código de barras que solo era ruido de fondo, una célula que ya estaba muriendo, dos células que comparten una etiqueta y ARN que se escapó de una célula y se contó en otra. Cada filtro es un umbral, y un umbral es una afirmación sobre lo que no pudo haber sido una célula. El más usado de todos — descartar por encima de un 5% de contenido mitocondrial — se ha medido en 5,530,106 células, y no sobrevive a un cambio de tejido.

En cifras las que están medidas

  • 13 / 44tejidos humanos en los que el valor por defecto del 5% mitocondrial falla al separar células sanas de las de baja calidad
  • 5,530,106células, en 1,349 conjuntos de datos anotados, detrás de ese hallazgo
  • 1.7%tasa de dobletes entre especies publicada para un kit combinatorio — un mínimo, no un total
  • 3comparaciones revisadas por pares de las dos químicas — y tres veredictos distintos

Qué elimina cada filtro, y con qué firmeza se sabe primero la firmeza, luego la afirmación

FirmezaQuéQuién lo dice
ConfirmadoCada filtro de la cadena tiene un método publicado detrás: EmptyDrops separa células del fondo; Scrublet, DoubletFinder y scDblFinder localizan dos células bajo una etiqueta; SoupX, DecontX y CellBender quitan el ARN contado en la célula equivocadalos propios artículos de método, de 2019 a 2023
ConfirmadoEl valor por defecto del 5% mitocondrial no distingue células sanas de las de baja calidad en 13 de los 44 tejidos humanos examinados, un 29.5%. El contenido mitocondrial medio es significativamente mayor en tejido humano que en el de ratón, y la plataforma de secuenciación no explica la diferencia. En tejidos de ratón el mismo umbral funciona bien en generalOsorio y Cai, Bioinformatics, 2021, sobre 5,530,106 células en 1,349 conjuntos de datos
ConfirmadoDe nueve métodos de detección de dobletes evaluados sobre 16 conjuntos reales con dobletes anotados experimentalmente y 112 sintéticos, DoubletFinder obtuvo la mejor exactitud de detección y cxds la mayor eficiencia computacionalXi y Li, Cell Systems, 2020
ConfirmadoEn organoides cerebelosos, el código de barras combinatorio y la captura en gotas dieron diversidad celular y reproducibilidad técnica comparables — pero el brazo de gotas presentó más células estresadas, y el combinatorio menores fracciones de transcritos mitocondriales y de proteínas ribosómicas y mayor diversidad de biotipos génicosSarieva y colegas, iScience, enero de 2026
Declarado por el fabricanteTasas de dobletes inferiores al 3% incluso con 100,000 células, y del 1.7% para una versión del kit frente al 1.3% de la anterior, medidas mezclando líneas celulares humanas y de ratón a partes iguales y contando los transcriptomas que llevan ambos genomasSuite de soporte y página de conjuntos de datos de Parse Biosciences, capturadas el 26 ago 2026
Declarado por el fabricanteEl ARN libre tendría que seguir el camino exacto de una célula a lo largo de cuatro rondas de codificación split-pool para asignarse mal — cifrado en 1 entre 3,538,944 — y un lavado retira las moléculas libres antes de la lisis. El ARN ambiental es peor que el dropout, porque el dropout pierde un gen mientras que el ambiental se lo da a la célula equivocada: un linfocito T CD8+ que se lee como si llevara CD4Suite de soporte de Parse Biosciences, capturada el 26 ago 2026; no se halló ninguna medición independiente de la cifra
Inferencia nuestraUn gráfico de mezcla de especies no puede ver un doblete formado por dos células de la misma especie. Con una mezcla al 50% entre dos especies, aproximadamente la mitad de los dobletes son invisibles, y cualquier cifra publicada entre especies es un mínimo de la tasa real, no una estimación de ella. Vale para la cifra de cualquier fabricante, no la de uno sololectura de este proyecto, sobre la aritmética de Bloom, PeerJ, 2018

Cómo se construyó el instrumental solo publicaciones — las páginas de soporte del fabricante llevan tres fechas cada una y no se sitúan aquí

  1. 2016Ilicic y colegas plantean el problema general de clasificar células de baja calidad, con más de un 30% de mejora en exactitud frente a métodos tradicionales en más de 5,000 células — Genome Biology
  2. Mar 2018SPLiT-seq: la ligación split-pool etiqueta el ARN de cada célula por código de barras combinatorio, sin microfluídica ni equipos a medida. 156,049 núcleos, más de 100 tipos celulares — Science. Es el método tras la plataforma combinatoria de todas las comparaciones siguientes
  3. Sep 2018Bloom deduce cómo se relaciona la tasa observada de transcriptomas mixtos con la frecuencia real de multipletes, para tipos celulares mezclados en cualquier proporción — PeerJ
  4. Mar 2019EmptyDrops identifica células contrastando cada código de barras con el perfil de expresión ambiental, y conserva tipos celulares que los métodos anteriores descartaban — Genome Biology
  5. Apr 2019Scrublet y DoubletFinder aparecen en el mismo número de Cell Systems. Ambos construyen dobletes artificiales a partir de los propios datos y preguntan qué células reales quedan más cerca de ellos
  6. Jun 2019Luecken y Theis publican el primer tutorial de buenas prácticas de principio a fin del campo, del control de calidad al análisis posterior — Molecular Systems Biology
  7. 2020El problema del ARN ambiental recibe sus herramientas: DecontX en marzo, que estima la contaminación por célula como una mezcla bayesiana, y SoupX en diciembre, que la cuantifica y corrige los recuentos. Entre ambas, en diciembre, Xi y Li evalúan nueve detectores de dobletes
  8. 2021Osorio y Cai ponen a prueba el 5% mitocondrial por defecto en 5,530,106 células y publican en su lugar valores de referencia para 121 tejidos de ratón y 44 humanosBioinformatics, mayo. scDblFinder llega en septiembre
  9. 2023Heumos y colegas extienden las buenas prácticas a varias modalidades en Nature Reviews Genetics, marzo. CellBender llega en agosto y modela el ruido de fondo de las gotas como un proceso generativo, con un funcionamiento cercano al límite teórico óptimo de eliminación de ruido en datos simulados — Nature Methods
  10. 2024Las dos químicas se comparan cara a cara, dos veces, y discrepan. Xie y colegas sobre PBMC humanas en marzo — International Journal of Molecular Sciences; Filippov y colegas sobre timo de ratón en noviembre — BMC Genomics
  11. Jan 2026Sarieva y colegas los comparan por tercera vez, en organoides cerebelosos, y hallan que la propia señal de estrés difiere entre ambos flujos de trabajo — iScience. Es el hallazgo técnico más reciente de esta página
  12. Aug 2026Contexto comercial, y solo la versión de una parte: Parse Biosciences anuncia que el Tribunal de Apelaciones del Circuito Federal de Estados Unidos rechazó el recurso de 10x Genomics, confirmando la invalidación de las patentes esgrimidas contra ella. Aquí no se leyó la resolución del tribunal, y la propia nota discrepa consigo misma: fechada el 19 de agosto en el texto y el 20 de agosto en la firma. Afecta a quién puede vender qué; no afecta a ninguna de las mediciones anteriores

Un umbral que no viaja qué dicen las mediciones, y qué no

La fracción mitocondrial es el caballo de batalla del control de calidad en célula única, y la lógica que la sostiene es buena: una célula estresada pierde transcritos citoplasmáticos por una membrana que falla, mientras que sus transcritos mitocondriales, encerrados en su propio orgánulo, se quedan. Así, la proporción mitocondrial de los recuentos de una célula sube conforme la célula muere, y toda célula por encima de cierta proporción se descarta. La proporción que usa casi todo el mundo es el 5%. Osorio y Cai señalan que la fijaron publicaciones tempranas, que se adoptó como valor por defecto en varios paquetes de análisis y que se asentó como estándar de hecho — y que su validez entre especies, tecnologías, tejidos y tipos celulares nunca se había evaluado como es debido. De modo que la evaluaron, sobre 5,530,106 células en 1,349 conjuntos de datos anotados. En tejido de ratón el umbral aguanta en general. En tejido humano no distingue células sanas de las de baja calidad en 13 de los 44 tejidos examinados, y el contenido mitocondrial medio es bastante mayor en humano que en ratón por razones que la plataforma de secuenciación no explica. Su respuesta no es una constante mejor, sino una tabla: valores de referencia para 121 tejidos de ratón y 44 humanos. Cinco años después, Sarieva y colegas vieron moverse de nuevo la misma métrica, esta vez con la química — el brazo de gotas de su comparación de organoides llevaba más células estresadas y mayores fracciones de transcritos mitocondriales y ribosómicos que el brazo combinatorio, sobre la misma biología. Un umbral que se desplaza con la especie, el tejido y el método de captura no es una propiedad de las células. Es una propiedad de un experimento, y se está escribiendo como si fuera de las células.

  • 29.5%de los tejidos humanos probados — 13 de 44 — donde el valor por defecto del 5% no separa las células sanas de las de baja calidad
  • 121 + 44tejidos, de ratón y humanos, para los que se publican valores de referencia en lugar de una cifra única
  • 1,349conjuntos de datos anotados detrás del hallazgo, con 5,530,106 células

Lo que esto no dice

No dice que la cifra del 5% sea errónea. En tejidos de ratón sus autores informan de que funciona bien en general, y en muchos tejidos humanos también sirve. El hallazgo va de transferencia, no de la cifra: un valor por defecto trasladado sin cambios desde el tejido en que se dedujo a un tejido que nadie comprobó.

Lo que sí dice

Un filtro no es maquinaria neutral. Cada célula que retira es una célula que el experimento ya no puede haber visto, y en casi un tercio de los tejidos humanos probados el filtro más común no distingue una célula moribunda de una rica en mitocondrias. Los autores lo dicen sin rodeos: omitir el filtro, o adoptar un umbral subóptimo, puede llevar a interpretaciones biológicas erróneas.

Cuatro cosas que aporta el resto de la literatura química, dobletes, ARN ambiental, escala

  • Química

    Tres comparaciones, tres veredictos

    Tejidos distintos, criterios distintos, respuestas distintas. Estas tres no se apilan en una clasificación, y ordenarlas como si lo hicieran sería una mentira de disposición.

    • PBMC humanas, dos donantes — frecuencias de tipos celulares comparables. El código de barras combinatorio capturó menos células pero detectó tipos raros, entre ellos plasmablastos y células dendríticas, gracias a una mayor sensibilidad de detección génica. La longitud génica y el contenido de GC se distribuyeron distinto entre plataformas (Xie, 2024)
    • Timo de ratón — el código de barras combinatorio detectó casi el doble de genes, y cada plataforma detectó un conjunto distinto. Pero los datos de gotas tuvieron menor variabilidad técnica y una anotación más precisa de los estados biológicos (Filippov, 2024)
    • Organoides cerebelosos — diversidad y reproducibilidad comparables, pero más células estresadas en el brazo de gotas y menores fracciones mitocondrial y ribosómica en el combinatorio (Sarieva, 2026)
  • Dobletes

    Nadie coincide en qué detector usar

    El último punto es lectura de este proyecto, apoyada en la aritmética que Bloom publicó en 2018. Léase una tasa publicada entre especies como un mínimo.

    • Xi y Li evaluaron nueve métodos y situaron a DoubletFinder primero en exactitud de detección y a cxds primero en eficiencia computacional (2020)
    • El artículo de scDblFinder afirma que un banco de pruebas independiente ya lo había situado por delante de las alternativas (2021). Es otro banco de pruebas, y no una repetición del primero
    • Sea cual sea el detector, el parámetro de entrada que suele pedir es una tasa esperada de dobletes — y las cifras disponibles para eso vienen de mezclas de especies, que no pueden ver un doblete de la misma especie
  • ARN ambiental

    El instrumental tiene forma de gota

    Lo que una herramienta dice de sí misma no es un fallo medido en otra parte. Nada de lo hallado aquí probó estas tres con datos de un flujo sin gotas.

    • SoupX, DecontX y CellBender se describen a sí mismos como métodos de gotas en sus propios resúmenes. El modelo de CellBender razona explícitamente sobre la diferencia entre gotas con célula y gotas vacías
    • El ARN ambiental es peor que el dropout, y la razón conviene retenerla: el dropout pierde un gen, mientras que el ambiental se lo entrega a la célula equivocada — un linfocito T CD8+ que se lee como si además llevara CD4
    • Un flujo de trabajo sin gotas no tiene gotas vacías que modelar. Parse Biosciences cifra sus propias probabilidades de mala asignación en 1 entre 3,538,944 a lo largo de cuatro rondas de codificación, más un lavado antes de la lisis — cifra del fabricante, aritméticamente consistente, y que nadie más ha repetido
  • Escala

    Qué dice de verdad la guía publicada

    Son cifras publicadas por un fabricante para una plataforma, no una regla general. Se citan porque están escritas y se pueden fechar, cosa que las versiones habladas de esas mismas cifras no permiten.

    • Profundidad mínima de secuenciación publicada para una plataforma combinatoria: 20,000 lecturas por célula para las versiones 2 y 3 del kit, y 10,000 para la versión 4 por su mayor eficiencia de biblioteca. Más profundidad para tipos raros en una población heterogénea; menos es defendible en una homogénea
    • Un tutorial publicado de un millón de células, sobre sangre periférica de 24 donantes, especifica una instancia en la nube de al menos 8 hilos y 160 GB de RAM
    • La anotación automática de tipos celulares, allí donde una plataforma comercial la ofrece, son ScType, Decoupler y CellTypist; el agrupamiento es Leiden o Louvain. Nada de eso es propietario, y elegir cuál es un juicio que la plataforma te devuelve

Cinco cosas que llevarse de aquí y una pregunta que nadie ha zanjado

  • Contrasta el umbral mitocondrial con tu tejido, no con el valor por defecto. Ya existen valores de referencia para 121 tejidos de ratón y 44 humanos, y en 13 de esos 44 la cifra del 5% no hace su trabajo.
  • Lee una cifra de dobletes por mezcla de especies como un mínimo. Muestre lo que muestre el gráfico, la mitad de dobletes de la misma especie nunca estuvo ahí — y esa cifra suele ser justo la que tu detector de dobletes te pide introducir.
  • No leas las comparaciones de plataformas como un marcador. Tres estudios revisados por pares, tres tejidos, tres respuestas distintas. Quédate con el que se parezca a tu tejido y a tu criterio, y toma los otros dos como prueba de que la cuestión sigue abierta.
  • Pregúntate si tu herramienta de ARN ambiental se hizo para tu química. Las tres más comunes dicen gota en sus propios resúmenes. Eso no prueba que fallen en otro sitio; es un motivo para averiguarlo antes de fiarte de los recuentos corregidos.
  • Trata una cifra del fabricante como lo que es. Cualquiera de las de esta página puede ser cierta. Ninguna se ha repetido de forma independiente, y cada una es una medición que una empresa hizo de su propio producto.

Sigue abierto

Qué detector de dobletes usar. Un banco de pruebas de nueve métodos situó a DoubletFinder primero en exactitud; el artículo de scDblFinder cita otro banco independiente que lo pone a él por delante. Ambos están publicados, aquí no se ha vuelto a ejecutar ninguno frente al otro, y esta página no elige entre ellos.

En resumen

Cada paso de esta cadena es un umbral, y un umbral es una afirmación sobre lo que no pudo haber sido una célula. El más usado del campo es demostrablemente específico de tejido y sensible a la plataforma, y se escribe como una constante. No es un fallo de la métrica. Es un fallo en arrastrar consigo sus condiciones — y esas condiciones llevan publicadas desde 2021, tejido por tejido.

Fuentes · Osorio y Cai, Bioinformatics 2021 · Xi y Li, Cell Systems 2020 · Sarieva y colegas, iScience 2026 · Filippov y colegas, BMC Genomics 2024 · Xie y colegas, International Journal of Molecular Sciences 2024 · Bloom, PeerJ 2018 · Ilicic y colegas, Genome Biology 2016 · Rosenberg y colegas, Science 2018 · los artículos de método de EmptyDrops, Scrublet, DoubletFinder, scDblFinder, SoupX, DecontX y CellBender, de 2019 a 2023 · Luecken y Theis 2019 y Heumos y colegas 2023 · suite de soporte y páginas de conjuntos de datos y de producto de Parse Biosciences, capturadas el 26 ago 2026