sábado, 29 de mayo de 2021

Variables de Confusión: Qué es la paradoja de Berkson, o sesgo de encuentro, y el riesgo atribuido al COVID

 Vamos a ver un caso muy especial que está asociado a las variables de confusión. La denominada Paradoja de Berkson, también denominada Sesgo de encuentro, sesgo de colisión, o falacia de Berkson. En inglés se denomina Collider Bias. 

La importancia de la paradoja de Berkson se encuentra en la interpretación de los estudios de bioestadística, de los estudios de biomedicina y de medicina. 

En el año 1946, un estadístico de la clínica de Mayo, en USA, hizo una observación que dejó un poco perpleja a la comunidad científica. Analizando los datos epidemiológicos del Hospital, se dió cuenta que la relación estadística entre las enfermedades puede ser engañosa si se la estudia solamente en pacientes de los hospitales. Qué significa esto?, que los datos de un hospital o una internación nos piede mostrar asociación entre dos condiciones, cuando en realidad no existe, o alternativamente, puede aparecer una asociación ficticia, o bien una asociación en sentido inverso. 

Pero, ¿Qué es lo que encontró Berkson específicamente?. Berkson estudió la diabetes y la inflamación de la vesícula, o colecistitis. Se sabe que la diabetes es un factor de riesgo para la inflamación, y naturalmente tendrían que estar correlacionadas positivamente, pero analizando los datos del hospital, Berkson encontró un correlación negativa entre las enfermedades. Inmediatamente Berkson publicó los resultados, sosteniendo que era una asociación espúrea o sesgada, por ser estudiada únicamente en personal hospitalario, aunque tardaría mucho tiempo hasta que la comunidad científica comience a tomarse en serio sus observaciones.

Para entender mejor esto, veamos un ejemplo que surgió unos años después. En 1979, el dr. Sackett encontró que el 7.5% de la población general tenía enfermedades de los huesos, y que este porcentaje no estaba relacionado para nada con la presencia de una enfermedad respiratoria. Pero si observaba en la población hospitalaria, es decir, en pacientes itnernados con enfermedad respiratoria, el porcentaje de personas con enfermedades en los huesos se disparaba al 25%. Si en la ciudad no habia alguna relación entre los huesos y las enfermedades respiratorios, porqué las personas internadas con enfermedades respiratorias tenían un gran número de problemas en los huesos. Sackett denominó a este sesgo, el sesgo de Berkson, o el sesgo de la tasas de admisión.

La cuestión se encuentra en que hay tres variables, la primera es una enfermedad, en este caso la enfermedad respiratoria, la segunda variable es la segunda enfermedad, la enfermedad de los huesos. Pero ambas variables influyen sobre la tercer variable, la denominada collider, o colisión, es la hospitalización. La probabilidad de encontrar a una persona que posea una enfermedad de huesos y una enfermedad respiratoria aumentan en la población hospitalaria, porque la muestra no es representativa. Ambas variables influyen en la hospitalización, y  por ende, en que muestra coy a tomar para analizar, es un sesgo de selección.

Otro caso interesante es el de los tests COVID en Gran Bretaña. Sabemos que en la población general , las personas de mayorpía de edad poseen una correlación entre el peso y la edad. A mayor edad, mayor peso. Es una de las asociaciones más consistentes en la medicina. Sin embargo, si tomamos solamente la población que que se ha realizado el test COVID, y analizamos la relación entre la edad y el peso entre los testeados, encontramos que la edad está inversamente correlacionado al peso. Es decir, a mayor edad, menor peso. ¿Como puede ser esto?, es otro caso de la paradoja de Berkson. 

Esto es porque en un momento los tests eran realizados primariamente a las personas de mayor riesgo, y quienes eran las personas de más riesgo, aquellas que eran jóvenes pero tenían alto peso, y personas mayores, que no eran necesariamente obesas. Si tomo esta subpoblación, la correlación entre la edad y el peso era inversa, al contrario que la población general.

Esto puede verse en el gráfico, donde la raya roja es la relación positiva que se obtiene entre la edad y el peso, mientras que la raya azul es la relación engativa que se observa entre las personas que obtuvieron el test.

En general, si dos factores influencian la manera en que son seleccionados en una muestra, se dice que esos factores "colisionan sobre la selección". En el casos del ejemplo de la enfermedad respiratoria y la del hueso, ambos factores influian directamente en la hospitalización. En el caso de la edad y del peso, las dos variables influían en si se tomaba el test o no se tomaba el test.

En el gráfico vemos una representación del fenómeno, las flechas indican las relaciones causales y la relación entre las variables puede ser alterada si ambas influyen en la selección de la muestra. Se pueden generar asociaciones que no existían anteriormente, como las enfermedades del hueso y respiratoria. O invertir relaciones existentes, como el peso y la edad; o exagerar algunas otras.

Veamos un tercer ejemplo. Un trabajo interesante, publicado por Herbert, Griffith y colaboradores en el año 2020, ilustra como esta paradoja puede explicar algunos resultados aparentemente sorprendentes que se observaron en la pandemia. 

Un trabajo epidemiológico que llamó mucho la atención a comienzos del año pasado fue a partir de unos datos que sostenían que el tabaco era un factor protector contra el COVID. La reacción inicial ante esta sugerencia fue tomada con mucho escepticismo. El Tabaco es muy malo para el sistema respiratorio, ¿como puede ser que sea beneficioso para el virus? . Pero los datos que emergían de los paises donde el virus pegó primero parecían avalar esta hipótesis: la proporción de fumadores entre los pacientes hospitalizados por COVID era una proporción mucho más baja que la proporción de fumadores de la población general. En China, el 8% de los pacientes hospitalizados por COVID eran fumadores, mientras que en la población general ese porcentaje llegaba a un 25%. En Italia, está diferencia era también notoria, el 8% de los hospitalizados fumaban, mientras que el 19% de la población general lo hacía. Era un resultado raro, ¿podría ser que el tabaco protegía a las personas de las hospitalizaciones por COVID, o estaba siendo otro caso de la paradoja de Berkson?

La explicación es la siguiente. Para que una persona sea hospitalizada, debe tener un grado serio de COVID. Por otro lado, el tabaco ocasiona un gran número de enfermedades colaterales, como cardíacas, cáncer, arteriosclerosis, etc, que pueden devenir en hospitalizaciones. Por tanto, una persona que está hospitalizada, tendrá un grado muy severo de COVID, o no será hospitalizada, pero entre los pacientes que no tengan COVID, habrá una mayor proporción de internados por causas relacionadas al tabaco, es decir, habrá una mayor proporcion de fumandores en internados no COVID. Dicho de otra manera, Los test COVID en los internados mostrarán menor tasa de infección entre fumadores que en no fumadores, porque los fumadores también están internados por enfermedades relacionadas al cigarrillo, y no necesariamente COVID. mostrando un sesgo de selección.

Por esta razón es tan importante el proceso de selección. El hecho de pertencer a un cierto grupo de riesgo poseer ciertos síntomas aumenta la chance de ser seleccioado para un test y colisionan en la selección. Es por eso que el proceso de selección debe ser representativo. Es importante donde la inferencia causal es el foco del trabajo.


Ecuación de la Regresión Lineal simple

 En el corazón de los análisis de las ciencias de la salud, normalmente es común o conveniente observar como es la relación entre dos variables. Digamos, edad y estatura, alimentación y ganancia de peso, o ingreso familiar y gastos médicos. 

La naturaleza e intensidad de las relaciones entre dos variables pueden ser analizadas por regresión y correlación. Las dos técnicas están relacionadas, pero sus usos son diferentes y cumplen diferentes funciones. 


El objeto de la regresión es predecir la forma de la relación entre las variables, y el objetivo final, es predecir o estimar el valor de una variable dado que se sabe el valor de otra variable.

Las ideas de regresión fueron expuestas primero por Sir Francis Dalton, investigando sobre la estatura humana. Concluyó que que la estatura de un individuo adulto, sin importar si desciende de padres altos o bajos, tiende a revertirse a la estatura promedio de la población.

Como todos los otros problemas en la estadísticas, los investigadores poseen muestras poblacionales de un apoblación real, en base a esa muestra se propone tomar una decisión con respecto a la población donde se extrajo la muestra. Por lo tanto, es importante que si uno va a utilizar un modelo de regresión lineal simple, este represente la población. No es de esperarse que el modelo represente fielmente la población, porque raramente se encuentra esto en modelos de aplicación práctica. Por otra parte, si se forzan los datos a un modelo que no se ajusta bien tampoco tiene valor. Sin embargo, un modelo que no está perfectamente ajustado no es un obstáculo para obtener valores útiles. Y ahi es donde juega el investigador, debe ser capaz de decidir cuando el modelo elegido y los dartos son lo suficentemenete compatibles como para poder proceder y en el que se deberá rechazar dicho modelo.

Tipos de Variables.

La regresión lineal simple utiliza dos variables. X e Y. A la variable X se la conoce como variable independiente, y es la que con frecuencia se encuetra en control del onvestigador, es decir, los valores de X pueden ser seleccionados por el investigador para obtener los valores de Y. Por cada valor de X que elija el investigador, correponderá un valor de Y que saldrá como respuesta. Por eso, a la variable Y se la denomina variable dependiente o variable de respuesta. Se habla de la regresión de Y sobre X

Supuestos

1. Los valores de la variable X son fijos, lo que quiere decir es que son previamente elegidos por el investigador, y no pueden variar. También se llama variable no aleatoria o variable matemática. 

2. La variable X se mide sin error, o con error insignificante.

3. Por cada valor de X, existe uns subpoblación de valores probables de Y. Para que las pruebas de hipótesis e inferencia estadística funcionene, esa subpoblación debe poseer un distriución normal 

4. Todas las varianzas de las subpoblaciones de Y son iguales, como se observa en el gráfico

5. Todas las medias de las subpoblaciones de Y se encuentran en la misma linea recta. Es la denominada suposición de linealidad


Donde u es la media de la subpoblación de los valores de Y para un X determinado, alfa y beta representan a los coeficientes de regresión de la recta. Alfa es la ordenada de origen y beta es la pendiente de la recta en donde están todas las medias. 

 6. Los valores de Y son estadísticamente independientes. En otras palabras, al extraer la muestra, los valores de Y obtenidos a partir de un valor de X de ninguna manera dependen de los valores de Y elegidos para otro valor de X.


Estas suposiciones se resumen en la siguiente ecuació, que es la del modelo de regresión.

Donde y es un valor representativo de una de las subpoblaciones de Y (para un X dado), alfa y beta son los coeficientes de represión y e es el error.

Se puede apreciar que despejando la fóruma nos queda que e indica la cantidad en que el valor y de la recta de regresión se desvía de la media de los valores Y de la población en que se extrae (uy|x). COmo consecuencia que las subpoblaciones Y siguen una distribución normal con varianzas iguales, los errores también deben seguir una distribuión normal con varianzas iguales a la varianza común de las poblaciones donde se extraen


EL primer paso en querer evaluar una relación es graficar un diagrama de dispersión, por ejemplo, la circunferencia de cintura y grasa abdominal. Si tenemos evidencia que están relacionadas linealmente podremos formar una recta. 

La recta de los mínimos cuadrados, es aquella recta que minimiza las desviaciones verticales al cuadrado de los puntos observados (yi) y es menor que cualquier otra recta.

Si la hipótesis nula no es rechazada (aceptada),la hipótesis de no diferencia, en esta, la pendiente de la curva es igual a 0. Es una relación lineal que tiene poco o ningún valor pronóstico para la otra variable, es probable que la dispersión tenga otra descripción no lineal.

Error de tipo I: rechazar una hipótesis nula verdadera. No hay diferencia, pero declaro que la hay, un falso Positivo


Hipótesis nula rechazada, se acepta la alternativa. Existe una relación lineal entre las variables. Se dice que un modelo lienal otorga un buen ajuste de datos

Error de tipo II: aceptar una hipótesis nula falsa. Hay diferencia, pero declaro que no la hay. un Falso Negativo.

Coeficiente de Determinación

Para evaluar el ajuste se observa la dispersión de puntos alrededor de la recta de regresión. La recta de regresión expresa la media de los valores






 

Asociación e Interacción

Es muy fácil confundir los términos de asociación e interacción en la estadística. Se puede asumir que para que dos variables interaccionen, si o si deben estar asociadas, o correlacionadas. Pero esto, no es cierto.

En la estadística, existen varias relaciones entre variables, y los términos de asociación e interacción tienen diferentes connotaciones, especialmente cuando estamos hablando de modelos de regresión ANOVA-

En breve, el término asociación consiste en una relación exclusiva de dos variables, por ejemplo, digamos, que esas dos variables son el la edad (X) y el peso (Y). Ahora, sabemos que el peso y la edad están correlacionados, porque el peso aumenta con la edad en la población

Si ponemos los datos en una curva de regresión, podemos decir que X, la variable independiente es la edad, e Y, la variable dependiente es el peso. Cuando aumentamos la edad, como respuesta, aumenta el peso.

Pero en la interacción, salimos de la relación estricta que tienen dos variables y nos adentramos en la relación que tienen las dos variables con una tercera.
Por ejemplo, introducimos la ingestión de te. Digamos que la toma de te es independiente d la edad, aproximadamente la misma cantidad de gente joven toma cafe que la gente más grande.
Las variables de tomar te y la edad no están asociadas en los más mínimo. Sin embargo, cuando vemos que efecto tienen sobre la variable respuesta, que en este caso es el peso, vemos que una mayor toma de te está asociada a un menor peso, y que com habíamos visto, una mayor edad también está asociado a la toma del te.
Sin embargo, al analizar más detalladamente las variables, podemos encontrar que el te tiene un efecto dietético mayor en personas mayores, y un efecto menor en personas de menos años. El problema de la interacción, es que si solo analizamos la edad y el peso, y no preguntamos si esas personas toman o no toman te, entonces podemos subestimar o sobreestimar el efecto de la edad.

Ese es el concepto, ahora veamos en detalle.

Ejemplo:

Veremos un ejemplo con tres variables, X1, X2 e Y.   X1 es independiente continua, X2 es independiente categórica e Y es dependiente. Aunque pueden tratarse de cualquier continua o independiente, es más fácil plotear así.

Volvamos a nuestro ejemplo, digamos que X1 es continua, la cantidad de te que tomamos, y X2 es categótica, la edad. Como vimos, la variable Y es el peso. Por conveniencia, vamos a graficar una de las variables independientes, el te, en el eje de las X, y la dependiente, el peso, en el eje de las Y.

Vemos como se comporta el gráfico de dispersión cuando no hay una asociación entre la edad y el peso, idealmente es una recta que va ascendiendo con una pendiente. Ahora introducimos la información de tomar el te, los puntos azules corresponden a los grandes tomadores de te, que llamaremos tomadores fuertes, y los puntos rojos son los tomadores débiles. En el caso que vemos, estos se distribuyen uniformemente en todo el gráfico. Por tanto, esto nos dice que no asociación entre las dos variables independientes y tampoco interacción. También nos indica que el té no está asociado al peso.

En el segundo caso, que pasaría si hay un asociación entre las variables independientes, digamos, a mayor cantidad de años, mayor infusión de te, entonces podríamos tener una distribución parecida a esta. donde las personas que menos toman te se acercan a las edades mas bajas, y que las que más toman te a las edades mas altas. Pero ojo, todavia no tenemos ningún tipo de interacción. Este es el caso de asociación sin interacción. También nos indica que el té no está asociado al peso.

Pero que pasaría ahora pasaría si el te tiene una asociación con la variable dependiente, el peso. Entonces obtendríamos dos rectas, una con aquellas personas que menos toman, que estaría expresando solamente la relación entre la edad y el peso, y otra recta, paralela, indicando las personas que más toman. Todavía no tenemos interacción. Solo para demostrar las diferencias en las rectas, en este caso vemos que hay asociación entre las variables, y en este otro vemos que las variables no están asociadas.

Una situación parecida es el peso en jóvenes, si se discrimina por sexo, veremos que los varones poseen más peso que las mujeres, y se obtienen dos rectas similares de acuerdo al sexo. A su vez, sabemos que hay una pequeña asociación entre el peso y el sexo.


Volvamos al primer caso, en que no hay asociación entre las variables o interacción. La media de X1, la cantidad de te, es la misma para todas las categorías de X2, la edad, no hay asociación. Pero como X1, en este caso, la cantidad de te, afecta al peso, va a depender de que categoría

Y ahora vamos al caso más complejo, en que tenemos asociación e interacción. Hay asociación entre el te y la edad, ya que habíamos establecido que más gente grande toma te, pero también hay interacción, porque el efecto dietético del té es más potente en personas más grandes.

Una nota al pie, a veces estas interacciones se vuelven aparentes recién cuando observamos los gráficos, por eso es que es importante detenernos y hacer la exploración de los datos antes de ver que está sucediendo exactamente con ellos.

viernes, 28 de agosto de 2020

Es confiable la PCR?


Voy a hacer este video porque últimamente se están diciendo muchísimas cosas por Internet respecto al virus y a la situación que estamos viviendo. De lo que voy a hablar específicamente, es sobre algo que conozco porque tengo experiencia. Que es la efectividad de la PCR en el área de diagnóstico. 

Como vimos en los videos pasados, la eficacia de una técnica, cuando hablamos estrictamente de la técnica, está dada por los parámetros denominados especificidad y sensibilidad. Para una descripción detallada sobre lo que es la especificidad y sensibilidad en el diagnóstico los invito a ver mi video pasado. 

Recapitulando, la probabilidad que el test detecte el virus en las personas infectadas se denomina sensibilidad, es una propiedad de la técnica. La especificidad, en contraparte, es la capacidad de la técnica de no detectar el virus en las personas sin infección.

Estos dos parámetros, sensibilidad y especificidad, son características propias de una técnica, pero no no nos hablan de la población de donde se toman las muestras, nos hablan de las características operativas del diagnóstico.

 Por ejemplo, una especificidad del 95% nos indica que del total de ensayos que se hacen a las personas sanas, va a salir correctamente negativo en el 95% de ellos, mientras que será un falso positivo en el 5%. 

Entonces, si uno va a hacerse un test y el test sale positivo, ¿Cómo se si es un falso positivo o un verdadero positivo?, ¿Cuál es la probabilidad que haya sido un error?. Un amala interpretación de este parámetro sería que, si tengo una especificidad del 95%, tengo una chance del 5% de tener un falso positivo. No, no es así, esto es una mala interpretación. La chance de ser un falso positivo es mucho menor, básicamente porque tenemos que considerar la cantidad de personas infectadas en la población y la sensibilidad de la técnica. 

Lo que queremos averiguar es la capacidad predictiva de la técnica, para eso tenemos que considerar el porcentaje de infectados en la población.. 

El valor que realmente estamos buscando es cuál es la probabilidad de poseer el virus si me salió positivo la técnica. O dicho de otra manera, me salió positiva la técnica, que probabilidad tengo de tener el virus. 

¿Porqué es importante saber la cantidad de virus circulante?,  porque cuanto menos virus tengo en la población, también disminuye la chance de informar un falso negativo, porque simplemente, no hay casi, virus, en el caso que no haya ningun virus circulando, entonces la posibilidad de informar un falso negativo es cero, porque no hay virus. En el caso contrario, si hay mucho virus circulando, la probabilidad de informar un falso positivo disminuye también, si, por ejemplo, toda la pobllación está infectada, la probabilidad de infectar un falso positivo es cero también. Entonces, el porcentaje de virus circulante influyen en la capacidad predictiva de la técnica. ¿Pero cómo sabemos con qué porcentaje de virus tenemos si no hemos realizado algún test?.  En realidad, no lo sabemos, lo podemos intuir, calcular por otros métodos.

Calculemos la capacidad predictiva de la PCR del virus con el teorema de Bayes

P(+|V) , es la sensiblidad de la técnica, que son los test positivos en las personas infectadas

P(V), es el porcentaje del virus circulante, cuyo valor podemos estimar

P(+), es el porcentaje de los test positivos que tiene la población, que es un dato empírico, sabemos cuantos no dieron positivo. Ahora, este valor, en realidad es la suma de los falsos positivos (+|-V) . P(-V) más los verdaderos positivos. 

Nos da la fórmula

P(V|+) = P (+|V) . P(V) / P(+)

Donde P(V|+)  srepresentan el porcentaje o probabilidad de los tests positivos que realmente tienen el virus.  Y que es el cociente entre la cantidad de ensayos positivos que me detectaron correctamente el virus, dividido todos los ensayos positivos.

Ahora, vamos a calcular la capacidad predictiva de la técnica en cuestión. Según lo reportado por los primeros estudios, la sensibilidad de la PCR están en 80%% aproximadamente, como son diferentes las técnicas algunas son 85%, otras 95%. 

Esto nos dice que la técnica tiene un 20% de falsos negativos, pero como vamos a ver a continuación, la sensibilidad no influye tanto en la eficacia de la técnica. Aparte, los negativos se realizan dos veces, disminuyendo esta probabilidad. Los parámetros que más afectan la eficacia de la técnica son la especificidad y la circulación del patógeno o virus. En general, la técnica de PCR es una técnica exquisitamente específica, porque se fundamenta en la complementariedad del ADN. Dicho de otra manera, puede ser que a veces en cantidades muy pequeñas  del virus no lo detecta, pero cuando lo detecta no se equivoca. La especificidad es del 99%, es decir, un 1% de falsos positivos. Ahora, digamos que la circulación del patógeno en la población está en un 40%.  Calculamos según la forma y nos da un 98% de calor predictivo positivo. Es decir, podemos asegurar que la tenemos un 98% de certeza que el test positivo me indica que tengo el virus. Pero, si la circulación del virus es más baja este porcentaje también lo hace, y si sube la circulación del virus también lo hace la chance de ser informado correctamente. Pero sobre todo siempre se encuentra por arriba del 90%.



0.8 * 0.4 / (0.8 * 0.4 + 0.01 * 0.6)

 0.08/ 0.08 + 0.0196

0.0996

80%

De acuerdo a estos datos, y considerando una sensibilidad del 77% y una prevalencia de 

0.81%

Si aumentamos la sensibilidad de la técnica a 0.85, el valor predictivo positivo se va a 0.89

La capacidad predictiva del test de PCR es muy buena, pero fundamentalmente en un aspecto, La técnica de PCR es una técnica altamente específica, es decir, disminuye grandemente los falsos positivos. Lo que generalmente se regula es su sensibilidad. Dicho de otra manera, es más probable que salga un falso negativo que un falso positivo, y está bien que sea así. De todas maneras, en la práctica, los resultados se repiten, lo que aumenta la eficacia de detección.

P (+|V) sensibilidad

P (-|V) falso negativo 

P (-|(-V)) especificidad

P(+| (-V)) falso positivo


jueves, 7 de mayo de 2020

Qué es y qué no es confusión en estadística



Por ejemplo, si estamos probando los efectos del ejercicio físico respecto a la longevidad de las personas jubiladas o retiradas, entonces tomamos un grupo de pacientes que caminan mucho y lo comparamos con otro que no caminan y los seguimos en un período de cinco años. En este caso, el ejercicio físico es X y longevidad es Y. ¿Qué esperaríamos en este ejemplo?. Esperamos que el grupo que realiza más actividad física sean más longevos que aquellos que lo hacen pobremente.
Ahora, si la edad promedio de los grupos es diferente al comenzar el estudio, podemos arribar a un resultado erróneo. Si, por dar un ejemplo hipotético, el grupo que realiza poca actividad física son en promedio más jóvenes que aquellos que caminan más, se registrarán más fallecimientos en el grupo que camina más, pero estas se deberán a las diferencias de edad de ambos grupos y no a los efectos del ejercicio físico. En ese caso, la Edad es el factor de confusión.

Ahora, uno se puede realizar otra pregunta, ¿pueden haber otros factores que no hayamos tenido en cuenta que modifiquen aún más los resultados?. ¿cuál era la dieta de los grupos?, ¿tenían enfermedades subyacentes?

Este es un ejemplo real, que proviene de un  trabajo realizado en Honolulu. En este trabajo se seguían a 8000 hombres jubilados desde el año 1965 hasta 1977. Los investigadores querían saber si un mayor ejercicio físico prolongaba la vida en hombres jubilados. Ellos encontraron que los que caminaban menos de una milla por día tenían una tasa de mortalidad dos veces mayor que los que caminaban más de una milla por día.
Los investigadores pensaron en todo esto, así que midieron la edad, dieta, cigarrillo, peso, enfermedades preexistentes. Y efectivamente encontraron una diferencia en el promedio de edad entre los grupos. Así que realizaron lo que se conoce como ajuste del factor de confusión o controlar por el factor de confusión. Él único requisito que se debe tener es medir la variable ateriormente. Ellos tenían la edad y muchas otras medidas de las personas. Lo que hicieron fue diviri a los grupos de pacientes y al grupo control en intervalos de edad, y medimos el efecto que tiene la dieta en pacientes y controles de cada intervalo por separado. Después promediamos los efectos, considerando o ponderando cuánto porcentaje de personas había en cada intérvalo de edad. Este procedimiento se denomina "ajuste de Z" o "controlar Z".

Luego de ajustar los resultados, encontraron que el 43% de los poco caminadores habían muerto,en comparación con el fallecimiento de solamente el 21% de los caminadores intensos.

¿Porqué es a veces muy difícil detectar la confusión en un estudio? 
La razón de tal dificultad se basa en dos premisas, primero es la diferencia entre lo que queremos calcular (la relación causal entre dos variables, X e Y, como vimos) y como diseñamos el estudio para detectarlo.
Hay dos conceptos fundamentales en la confusión: la incomparabilidad de los grupos, como vimos, y la búsqueda de la tercer variable o de confusión.
Cuando decimos que vamos a comparar dos tratamientos, por ejemplo, una vacuna y un placebo, los grupos a quienes probamos deben ser iguales en las variables más importantes. Pero... que son las variables más importantes para ese tratamiento? Cómo se que la edad es importante para los caminadores de Honolulu?, pensamos que el sentido común nos dará la respuesta, pero las cosas siempre son más complicadas de lo que parecen.
El problema de la definir la variable de confusión también es problemático. Es una variable que tenga una causa común con X o Y, o es simplementa una variable que esté correlacionada con X o Y.
Entonces tenemos dos grupos de definiciones:
Proce

Cómo funciona la edición genética de Cripsr?


Hola, vamos a ver cómo funciona la edición genética por CRISPr. En este primer video veremos la función natural, en la continuación como es utilizado para ingeniería genética.

El sistema fue descubierto en las bacterias a comienzos del siglo por al menos tres investigadores de manera independiente. Se trata de un sistema de inmunidad adquirida o adaptativa en bacterias. Dicho de otro modo, es una manera en que las bacterias se defienden de los virus, denominados también bacteriófagos, y tienen memoria de una infección anterior para evitar que el mismo virus vuelva a atacarlos, por eso es denominada inmunidad adaptativa.
La verdad que esto fue una gran revolución en el campo de la microbiología porque hasta el momento solo se sabía que los organismos superiores presentaban ese tipo de inmunidad. Es más, cuando los primeros autores enviaron sus resultados a revistas notorias como Nature o Science, fueron rechazados porque simplemente no creían que eso fuera posible.

El mecanismo básico se divide en tres etapas, en la primera etapa, denominada adquisición, el virus entra a la bacteria y libera su ADN o ARN, el sistema cripsr reconoce el ADN del virus y mediante las proteínas Cas1 y Cas2, lo corta y lo agrega a su genoma para después reconocer un nuevo ataque. ¿cómo lo hace?, Cripsr es toda una familia que tiene numerosas variantes, pero en general comparten Cas1 y Cas2, que reconoce una secuencia que comparten los fagos que se denomina protoespaciador, estas proteínas los reconocen y cortan en lugares adyacentes, la función de cortar el ADN se denomina función nucleasa y ribonucleasa, cortan el ADN del virus, y pegan el ADN del virus en el genoma de la bacteria, por decirlo de alguna manera, en el locus de CRIPSR. Como ven  acá, el locus CRIPr está formado por los genes CAS, seguido de una secuencia lider, y secuencias repetidas denominadas repetidos Crispr y espaciadores, el ADN del virus es copiado en los espaciadores.

El locus CRIPSR dentro de la bacteria tiene la siguiente disposición, esto es un modelo, porque puede variar de acuerdo a las especies. los genes CAS, una secuencia lider seguido por repetidos crispr y los espaciadores con la secuencia del virus. Dentro del lider se encuetra el promotor de transcripción, que es donde se inicia el pasaje de ADN a ARN, todos el arreglo es transcripto como una sola cadena que luego es procesada. Como es procesada deriva en tres tipos, I, II y III. La manera en que cortan difieren en los tres sistemas, utilizando genes cas6 o ARNasaIII. Independientemente como fueron procesados el ARN que proviene del espaciador será utilizado como guía para reconocer el ADN foráneo.

En la útima etapa los ARNcrispr se unen a las proteínas CAS para formar complejos riboproteicos que reconocen al ADN del fago y lo cortan. Estos complejos circulan dentro de la bacteria en busca de ADN de virus y reconocen el proto espaciador para cortarlo. Los tres tipos difieren en la composición. Uno de los sistemas, el denominado tipo II, tiene mucho interés, porque el ARN de Crispr se acompleja con Cas9, que está formado por dos endonucleasas que inactivan el blanco. Modificaciones de este sistema se utiliza para inactivar genes en ingeniería genética.



viernes, 8 de noviembre de 2019

Factores de Confusión: ¿Qué son?, ¿como se miden?


La variable de confusión, o factor de confusión, es un concepto simple en teoría, pero por varias razones es complicado de definirlo. Este concepto es sumamente importante en ciencias y especialmente en biomedicina, porque toca un tema fundamental como es la causa de las enfermedades.  El primer autor que trató explícitamente el tema de la confusión fue el filósofo y economista británico John Stuart Mill , a mediados del siglo XIX, el cuál propuso como una necesidad vital en las investigaciones evitar todos los factores que pudieran estar afectando la relación entre una causa y su efecto. 

Veamos un ejemplo, la manera más fácil de entenderlo es visualizar las relaciones entre las variables como si fueran diagramas. En este caso digamos que X es mi variable causa e Y es mi variable efecto.Así,  Z, es mi variable de confusión. El ejemplo clásico que se da en este tipo de explicaciones es el de la relación del cigarrillo y el cáncer de pulmón.

En este caso está bien establecido que la variable fumar es la causa, y el cáncer de pulmón, es el efecto. Si calculamos el Riesgo Relativo de la enfermedad, obtendremos un valor aproximadamente de 7, dependiendo de la población que se estudie. ¿Cómo calculamos el riesgo relativo?  Estos resultados se pueden estimar calculando el número de individuos que fuman y desarrollaron la enfermedad y dividirlo por la cantidad de individuos que no fuman y desarrollaron la enfermedad. El resultado se puede interpretar de la siguiente manera: Los individuos que fuman tienen 7 veces más chances de enfermar por cáncer de pulmón que aquellos que no fuman.

Ahora, digamos que deseamos replicar estos resultados con nuestras muestras y no consideramos las variables de confusión, el resultado podría no será preciso. Un ejemplo de confusión es la edad, por ejemplo, si no consideramos la edad antes de planificar la investigación, podríamos haber elegido en el grupo de  individuos fumadores, muchos más jóvenes que adultos, donde a pesar de ser fumadores la enfermedad no ha tenido la oportunidad de expresarse; y en el grupo de los no fumadores podrían haber, en contraposición, una mayoría de personas grandes, tal vez presentando algunos casos de cáncer de pulmón que son el resultado del avance de la edad y no por el cigarrillo. Al tener 10 casos en el grupo de fumadores y 10 en el grupo de no fumadores, nuestro riesgo relativo es igual a 1. No hay asociación.

En este caso es claro que la Edad es un factor de confusión. Otro ejemplo Un ejemplo es el café y el cáncer de pulmón. Algunos estudios del siglo XIX habían encontrado asociaciones fuertes entre tomar el café y el mal del pulmón, con riesgo relativos cercnos a 5 .  Lo que había pasado es que los fumadores tenían y tienen por costumbre ser grandes consumidores de café. La asociación que se veía entre el café y la enfermedad era, en realidad, la del efecto del tabaco en los tomadores de café. En este caso el tabaco era el factor de confusión para las conclusiones entre las variables café y cáncer de pulmón, estaba asociado a la toma de café por un lado, y por el otro lado estaba asociado al cáncer de pulmón.

En síntesis, una variable de confusión es aquella que distorsiona la medida de la asociación entre otras dos variables. El resultado puede ser la observación de un efecto donde en realidad no existe (Asociación espúrea), la exageración de una asociación real (confusión positiva) o, por el contrario, la atenuación de una asociación real (confusión negativa).

Finalmente, me gustaría aclarar que la confusión es un concepto causal, aunque en la práctica es determinado mediante asociaciones estadísticas y correlaciones. En el próximo video hablaré un poco de las dificultades de definir formalmente lo que es o lo que no es confusión. Espero que les haya gustado.

YouTube, que son las variables de confusión




¿Es la edad del calendario igua a nuestra edad biológica?

Se dice que el tiempo que se desperdicia no se recupera más y que el reloj es un enemigo imbatible. Durante décadas, el avance de la ciencia...