3. Results
3.6 Application of the established dataset in a novel gene discovery, Mercuric reductase
Los criterios de información propuestos por Akaike (AIC) [75] y por Schwarz (BIC) [76], nos permiten analizar un conjunto de modelos candidatos M1, M2, … , Mi que ajustan una determinada muestra x1, x2, …., xp extraída de la población en estudio y sobre la cual se desea inferir información. Ambos criterios, seleccionan aquel modelo M que mejor ajusta los datos de la muestra, considerando M el modelo que presenta menor valor AIC (o BIC) dentro de los candidatos.
Modelos con un mayor número de parámetros tienden a ajustar mejor una base de datos, no obstante tienden a ser más inestables y a modelar la variabilidad de esos datos más que su tendencia [77]. Mediante los criterios de selección de modelos se mide el ajuste (‘fit’) de un modelo dado, maximizando el valor de la función de verosimilitud y ‘penalizando’ la cantidad de parámetros que son estimados en dicho modelo.
La elección de un modelo con muy pocos parámetros puede implicar hacer suposiciones simples y poco realistas, conduciendo a un alto sesgo y con poca predicción. Tales modelos no son lo suficientemente flexibles para describir correctamente la muestra o la población. Por lo contrario, un modelo con demasiados parámetros es capaz de ajustar muy bien los datos de la muestra, con el riesgo de sobreajustar los mismos, es decir, ajustarse estrechamente a la muestra en sí con bajo poder de generalización [78].
En forma genérica, y de acuerdo a Atkinson [78] es posible generalizar algunos de los criterios de selección de modelos basados en información, entre ellos el criterio de Akaike y el criterio Bayesiano mediante la siguiente ecuación
156
donde ‘l’ corresponde al logaritmo de la máxima verosimilitud (log-verosimilitud), ‘An’ es una
función (que puede tomar el valor de una constante) del tamaño de la muestra ‘n’, y ‘p’ se corresponde con el número de parámetros utilizados en el modelo. Es necesario que An tome
un valor específico en la ecuación para poder implementar el criterio. Las propuestas de Akaike y Schwarz corresponden a distintos valores de An, modificando el grado de
penalización del criterio por utilizar p parámetros.
Los criterios de información que presentan la forma (1) (como lo son AIC y BIC) representan la función log-likelihood (término izquierdo de la ecuación) con una penalización (término derecho). El término izquierdo utiliza 𝑙 = 𝑙𝑜𝑔𝐿𝑖𝑘, es decir el logaritmo de la máxima verosimilitud. Utilizar el logaritmo y no la función verosimilitud en forma directa, es una estrategia muy común en estadística para simplificar cálculos algebraicos (por ejemplo, un producto a través del logaritmo se transforma en una suma, con lo cual resulta más fácil trabajar). A fines de comprender (1) y sin ahondar por demás, definiremos la función de verosimilitud de acuerdo a Devore [79] de la siguiente manera:
Supongamos que X1, X2, … , Xn poseen una función densidad de probabilidad
𝑓(𝑥1, 𝑥2, … , 𝑥𝑛; 𝜃1, 𝜃2, … , 𝜃𝑚) (2) Donde 1,…, m representan distintos parámetros desconocidos. Siendo x1, x2, … ,xn valores muestreales observados y siendo (2) una función de los parámetros 1,…, m se define la función de verosimilitud. Las estimaciones de máxima verosimilitud 𝜃̂1, … , 𝜃̂𝑚 son aquellos valores de las i que incrementan al máximo la función de probabilidad de tal modo que 𝑓(𝑥1, 𝑥2, … , 𝑥𝑛; 𝜃̂1, 𝜃̂2, … , 𝜃̂𝑚) ≥ 𝑓(𝑥1, 𝑥2, … , 𝑥𝑛; 𝜃1, 𝜃2, … , 𝜃𝑚) con todos los 1, … , m
De esta manera, la función de verosimilitud nos dice qué tan probable es que la muestra observada sea una función de los posibles valores de parámetros [79]. Al incrementarse al máximo la probabilidad se obtienen los valores de parámetros con los que la muestra observada es más probable que haya sido generada, es decir, los valores de parámetros que ‘más concuerdan’ con los datos observados.
157
Criterio de información de Akaike (AIC).
El AIC utiliza un valor An=2, con lo que remplazando en (1) toma la forma
𝐴𝐼𝐶 = −2 ∗ 𝑙 + 2 ∗ 𝑝 (3) El criterio se basa en la estimación de la distancia relativa de Kullback-Leibler (KL) de la función verosimilitud del modelo candidato ajustado a las observaciones, a la función verosimilitud desconocida de la población. El objetivo de selección de modelos mediante el AIC es estimar la pérdida de información cuando la distribución de probabilidad f, asociada con el modelo verdadero, es aproximada mediante la distribución de probabilidad g, asociada con el modelo candidato que va a ser evaluado. Una medida para la discrepancia entre el modelo real y el modelo aproximado viene dada por la cantidad KL. La distancia de Kullback- Leibler se define como 𝐸𝑡(𝑙𝑡(𝑦)) − 𝐸𝑡(𝑙(𝑦)) , donde Et representa el valor esperado bajo la función de distribución verdadera (desconocida), l es la log-verosimilitud de los datos ajustados al modelo considerado, y lt es la log-verosimilitud de los datos de la distribución
verdadera (desconocida). Como 𝐸𝑡(𝑙𝑡(𝑦)) es el mismo valor independientemente del modelo
en cuestión, la distancia KL se minimiza eligiendo el modelo que presenta el máximo valor 𝐸𝑡(𝑙(𝑦)). Bajo esta consideración, se logra escoger el modelo que más se aproxima al modelo
real. Akaike estableció el criterio basado en este principio arribando a la ecuación (3), ya que aquel modelo ajustado con un bajo valor en (3) es más probable que proporcione una función verosimilitud cercana a la verdadera (desconocida).
El criterio de Akaike no identifica el modelo verdadero. Sólo es capaz de identificar el mejor modelo dentro de un conjunto de modelos candidatos, en el sentido de que proporciona la aproximación más cercana a la realidad o al verdadero modelo. Entre las ventajas del AIC se destacan su simplicidad y facilidad para ser implementado, como así también la ventaja de no requerir un nivel de significación específico para contrastar dos modelos.
Criterio de Información Bayesiano (BIC).
Fue propuesto por Schwarz en el año 1978. Algebraicamente, es similar al criterio AIC, pero con la diferencia de penalizar en función del tamaño muestreal. Mientras que el AIC presenta un término de penalización 2*p, independiente del tamaño de la muestra, implicando que un
158
mismo número de parámetros comunes sea seleccionado tanto para muestras pequeñas como para muestras grandes, el criterio BIC utiliza una penalización ln(𝑛) ∗ 𝑝 con An=ln(n), siendo ln la función ‘logaritmo neperiano’ y n el tamaño de la muestra. Reemplazando en (1) resulta
𝐵𝐼𝐶 = −2 ∗ 𝑙 + ln(𝑛) ∗ 𝑝 (4) El procedimiento de selección de un modelo en base al criterio BIC es el siguiente: se calcula el BIC de los distintos modelos M1, M2, …, Mi y se selecciona el modelo dentro de los candidatos que minimiza el valor BIC.
Debido al grado de penalización del BIC, este criterio se inclina, a diferencia de AIC, hacia modelos de dimensión baja, siempre y cuando el número de observaciones sea n ≥ 8 [80]. AIC, para muestras pequeñas o grandes, tiende a seleccionar modelos con más parámetros de los necesarios [80]. Estas diferencias implican que el modelo BIC tienda a producir errores de
underfitting a diferencia de AIC en la selección de parámetros que tiene a producir errores
159