• No results found

All children retained in elementary education

In document SARVA SHIKSHA ABHIYAN (SSA) (Page 91-94)

GOAL IV: Education of Satisfactory Quality

Goal 3 All children retained in elementary education

El objetivo del recomendador es el de proporcionar r

características propias de las imágenes sin tener en cuenta información semántica de las mismas. Para ello es necesario realizar una caracterización de la manera general de definir y describir esas imágenes, en los términos de

información valiosa a la hora de aplicar posteriormente los algoritmos de recomendación. Esta caracterización ha quedado plasmada en

primer lugar se ha realizado una definición y selección de los descriptores que se utilizan para caracterizar las imágenes de una manera general (independiente del gusto de cada usuario).

En el proceso seguido, con el fin de partir

comenzado realizando un estudio de los descriptores definidos en el estándar MPEG [50] cuya información pudiera ser de especial interés en el proceso. Sin embargo, se ha comprobado que estos descriptores necesitan ser reformulados para poder extraer información directamente aprovechable. Del mismo modo, se han desarrollado descriptores nuevos que vienen a complementar la labor de los anteriores.

La Fig. 30 recoge todos los descriptores que finalmente se han empleado en el sistema de recomendación, dentro de lo que se ha denominado dominio D, de carácter general para todos los usuarios. Además, se presenta como ejemplo el proceso de extracción de uno de los descriptores, correspondiente a la homogeneidad de líneas.

Fig. 30. Descriptores seleccionados para la clasificación de las imágenes y ejemplo de HDL

Como se aprecia en la Fig.

de los cuales constan de varias dimensiones, por lo que al final cada imagen resulta representada por un vector de 16 dimensiones:

85

Modelo de extracción de características y anotación de

imágenes para la recomendación

El objetivo del recomendador es el de proporcionar recomendaciones basadas en las características propias de las imágenes sin tener en cuenta información semántica de las mismas. Para ello es necesario realizar una caracterización de la manera general de definir y describir esas imágenes, en los términos deseados y de manera que se cree información valiosa a la hora de aplicar posteriormente los algoritmos de Esta caracterización ha quedado plasmada en [36]. Por lo tanto, en primer lugar se ha realizado una definición y selección de los descriptores que se utilizan para caracterizar las imágenes de una manera general (independiente del gusto

En el proceso seguido, con el fin de partir de materiales estandarizados, se ha comenzado realizando un estudio de los descriptores definidos en el estándar MPEG

cuya información pudiera ser de especial interés en el proceso. Sin embargo, se ha comprobado que estos descriptores necesitan ser reformulados para poder extraer información directamente aprovechable. Del mismo modo, se han desarrollado

os que vienen a complementar la labor de los anteriores.

recoge todos los descriptores que finalmente se han empleado en el sistema ro de lo que se ha denominado dominio D, de carácter general para todos los usuarios. Además, se presenta como ejemplo el proceso de extracción de uno de los descriptores, correspondiente a la homogeneidad de líneas.

riptores seleccionados para la clasificación de las imágenes y ejemplo de HDL

Fig. 30, se han definido finalmente nueve descriptores, algunos los cuales constan de varias dimensiones, por lo que al final cada imagen resulta representada por un vector de 16 dimensiones:

Modelo de extracción de características y anotación de

ecomendaciones basadas en las características propias de las imágenes sin tener en cuenta información semántica de las mismas. Para ello es necesario realizar una caracterización de la manera general de seados y de manera que se cree información valiosa a la hora de aplicar posteriormente los algoritmos de Por lo tanto, en primer lugar se ha realizado una definición y selección de los descriptores que se utilizan para caracterizar las imágenes de una manera general (independiente del gusto

de materiales estandarizados, se ha comenzado realizando un estudio de los descriptores definidos en el estándar MPEG-7 cuya información pudiera ser de especial interés en el proceso. Sin embargo, se ha comprobado que estos descriptores necesitan ser reformulados para poder extraer información directamente aprovechable. Del mismo modo, se han desarrollado

os que vienen a complementar la labor de los anteriores.

recoge todos los descriptores que finalmente se han empleado en el sistema ro de lo que se ha denominado dominio D, de carácter general para todos los usuarios. Además, se presenta como ejemplo el proceso de extracción de

riptores seleccionados para la clasificación de las imágenes y ejemplo de HDL

, se han definido finalmente nueve descriptores, algunos los cuales constan de varias dimensiones, por lo que al final cada imagen resulta

86

" $E , m , !n, o , op, e , F , Fr, Fs, N, VCwxyz{, VCwxy|z, SC, ~6, ~p, T•& (

39

) Algunos de estos descriptores han sido obtenidos a partir de los tres descriptores de MPEG-7 que han resultado útiles, EHD (Edge Histogram Descriptor), DCD (Dominant Color Descriptor) y CLD (Color Layout Descriptor); otros, sin embargo, son directamente extraídos de las imágenes.

El siguiente apartado explicará brevemente las características de estos tres descriptores de MPEG-7 que han servido de base, mientras que el posterior apartado del capítulo se centrará en la explicación de cada uno de los nueve descriptores empleados en la fase de clasificación.

Descriptores base MPEG-7

EDGE HISTOGRAM DESCRIPTOR (EHD)

Se trata de un descriptor de texturas encargado de representar la distribución de bordes en la imagen a partir de su división en 4x4 subimágenes y la obtención de los histogramas correspondientes al reparto de bordes locales en cada una de ellas. Para generar dicho histograma los bordes son clasificados de acuerdo a su dirección: horizontal, vertical, diagonal 45º, diagonal 135º y sin dirección, obteniéndose con ello un total de 5x16=80 intervalos de histograma para cada imagen.

DOMINANT COLOR DESCRIPTOR (DCD)

Este descriptor de color se encarga de proporcionar una descripción compacta de los colores representativos en cada imagen, aportando:

- El número total de colores dominantes con un máximo de 8 e independiente para cada imagen.

- Su coherencia espacial, que representa la homogeneidad espacial de cada uno de los colores detectados.

- Su porcentaje o fracción de pixeles en la imagen correspondiente al color dado. - Su varianza (opcional), encargada de indicar la fluctuación de los valores del

color dentro de un cluster centrado en el color representativo detectado. - Su valor en RGB.

El descriptor se proporcionado en forma binaria, cumpliendo la siguiente sintaxis: - Número de colores: 3 bits que indican el número total de colores dominantes

detectado.

- Coherencia espacial: 5 bits.

- Porcentaje: 5 bits que indican el porcentaje normalizado asociado a cada color dominante.

- Varianza de color: 1bit.

- Valor: cada color dominante según su RGB.

En cuanto a su extracción, y tal y como se indica ampliamente en [53], se parte de un cluster único con un color representativo como centroide para cada imagen. A

87

continuación se realiza una secuencia de nuevos cálculos de centroides hasta alcanzar el criterio de parada elegido (mínima distorsión o máximo número de iteraciones). A partir de este punto, los clusters con mayor distorsión son divididos mediante la utilización de vectores de perturbación hasta que dicha distorsión descienda por debajo de un umbral o, en su defecto, hasta alcanzar el mayor número de clusters definidos.

En lo referente a la coherencia espacial, este parámetro se obtiene a partir del análisis de conexión de componentes, es decir, mediante la identificación de grupos de pixeles con el mismo color dominante que se hallen espacialmente conectados, haciendo uso para ello de una conectividad a cuatro (los cuatro vecinos más próximos a cada pixel).

COLOR LAYOUT DESCRIPTOR (CLD)

Este descriptor está diseñado para representar de forma eficiente la distribución espacial de colores de la imagen tratada. Se obtiene a partir de la aplicación de la transformada discreta del Coseno (DCT) a los colores de la imagen en el espacio YCrCb, previa división de ésta en 64 bloques. El proceso completo consta de los siguientes pasos:

- División de la imagen

- Detección del color representativo - Aplicación de la DCT

- Cuantificación no lineal de los coeficientes escaneados en forma de zigzag.

Descriptores finales del clasificador para el sistema de recomendación

Según la naturaleza de los nuevos descriptores generados, estos se han clasificado en tres grandes bloques: textura, luminancia y crominancia.

1. Textura: Energía de líneas (EDL)

A partir del descriptor EHD se ha diseñado este parámetro que pretende medir la densidad de líneas en la imagen a partir de su energía con el objetivo de poder diferenciar aquellas imágenes con una numerosa cantidad de líneas de otras en las que no haya apenas transiciones.

Este parámetro está compuesto por un único valor que aporta la información obtenida, y que se halla de la siguiente forma:

n€ b•. nsƒ° n…†° n rƒº n ˆ†° n-•‰dŠ (

40

) 2. Textura: Homogeneidad de líneas (HDL)

Desarrollado también a partir del descriptor de MPEG 7 EHD, este descriptor se encarga de estudiar la continuidad de las líneas en la imagen. Cuenta también con una única dimensión H1, cuyo valor se obtiene dividiendo la imagen original en 16

subimágenes. Entonces, se halla la varianza de la distribución de líneas entre las 4x4 subimágenes vecinas, como muestra la siguiente expresión:

88 Donde:

V1= varianza entre las subimágenes (1,1),(1,2),(2,1),(2,2)

V2= varianza entre las subimágenes (1,3),(1,4),(2,3),(2,4)

V3= varianza entre las subimágenes (3,1),(3,2),(4,1),(4,2)

V4= varianza entre las subimágenes (3,3),(3,4),(4,3),(4,4)

V5= varianza de V1, V2, V3, V4.

Y teniendo en cuenta la distribución de líneas a lo largo de cada dirección. 3. Textura : Variedad de entropía (VE)

Este parámetro representa la varianza de la entropía a lo largo de toda la imagen, y se calcula dividiendo la imagen en un conjunto de 5x5 subimágenes y obteniendo el valor de la entropía para cada uno de ellos. El parámetro final es la varianza entre esos 25 valores de entropía localizada.

4. Luminancia: Entropía por planos de bits (EPB)

Con este descriptor se pretende hacer un estudio de la distribución de entropías según planos de bits, de acuerdo a lo explicado en [55]. El procedimiento es el siguiente: la imagen se pasa a escala de grises, donde cada pixel tiene un valor de entre 0 y 255 (codificado en 8 bits), resultando (b7,b6,b5,b4,b3,b2,b1,b0). Se realizan 8 planos con los valores 0 o 1 de cada pixel en cada plano, realizando posteriormente una conversión de cada uno a código de grises, que proporciona más información:

D ‹B Œ BUB , ; Ž % 1, 0 • ; • Ž % 20 (

42

) Donde Œ es la operación XOR, B es el i-ésimo plano de bit e i es el i-ésimo plano expresado en escala de grises.

A continuación se hace uso de los cuatro planos superiores que contienen la mayor parte de la información estructural, y se obtiene con ellos un vector de entropías de cuatro componentes, una por cada plano.

La estructura de este descriptor es, por tanto, la de un vector con cuatro componentes, una por la entropía de cada plano de bits contemplados, de la forma [E1, E2, E3, E4]

5. Luminancia: Luminancia media (LM)

A partir del descriptor CLD de MPEG-7 se analiza el grado de continua de cada imagen, con el objetivo de identificar el nivel medio de la imagen. De esta forma se pueden diferenciar fácilmente aquellas imágenes luminosas de las que contienen tonos muy apagados u oscuros, con lo que se puede determinar la importancia de esta característica para cada usuario. Para ello, es necesario obtener una transformada DCT (Discrete Cosine Transform) sobre el espacio de color YCrCb de la imagen.

Este descriptor está compuesto por dos valores, incluyendo por una parte su valor medio, y por otra su varianza, que aporta información acerca de la dispersión de la primera, obteniéndose con ello un vector de dos dimensiones de la forma [Lc,Lv]

89 6. Crominancia: Saturación de HSV (SA)

En este caso se realiza un cambio de espacio de color para realizar el estudio del tono y la saturación de las imágenes elegidas, con el objetivo de determinar su impacto a la hora de su elección. Al igual que en el caso de la luminancia, este parámetro viene determinado por dos valores: por un lado el valor medio y por otro su varianza, de la forma [Sm, Sv].

7. Crominancia: Variedad cromática (VC)

Descriptor generado a partir del DCD de MPEG7, se encarga de determinar la variación de color a lo largo de la imagen estudiada, obtenida a partir de los colores dominantes detectados. Viene dado a partir de tres valores: el numero de colores dominantes, la varianza entre los diferentes tonos del mismo color, y la varianza entre los distintos colores (variedad intra e intercromática), de la forma [N, VCintra, VCinter].

8. Crominancia: Coherencia espacial (CE)

Desarrollado a partir del DCD como en el caso anterior, su objetivo es determinar la continuidad o ausencia de la misma en cuanto al color de la imagen estudiada. Viene representado a partir de una única componente. Su extracción resulta análoga a la especificada para el descriptor DCD de MPEG-7 en [50].

9. Crominancia: Planaridad de color (PC)

Este descriptor representa la homogeneidad de cada color dominante en la imagen en términos de tono. Por ejemplo, una imagen en la que se repitan dentro de cada región de la imagen tonos muy similares tendrá una planaridad muy superior a la de una imagen abigarrada, en la que los colores se entremezclen de manera dispersa o caótica.

Se calcula de la siguiente manera: se divide la imagen en bloques cuadrados de píxeles, de tamaño proporcional al tamaño del lado menor de la imagen dividido por un coeficiente (que en nuestros tests ha tenido un valor de 8). Posteriormente se selecciona el color más frecuente de cada bloque y se calcula el porcentaje de píxeles que este contiene con un color similar (se ha estimado una diferencia de 20 dentro del sistema RGB). El valor final de la planaridad de color es el resultado del valor medio de esos porcentajes de píxeles para los distintos bloques.

Otros descriptores descartados

En el proceso de generación de descriptores relevantes, se obtuvieron otros descriptores de los que se esperaba obtener buenos resultados y que sirvieran para una clasificación más eficaz de las imágenes, y más acorde con la percepción sensorial del ojo humano. Sin embargo, las pruebas posteriores realizadas con usuario sirvieron para descartarlos, ya que no aportaban información relevante de las imágenes que resultara útil en la recomendación. De todos modos, en el futuro es posible seguir trabajando sobre ellos para poder llegar a incorporarlos con mejores resultados. Los descriptores descartados que se definieron con mayor claridad fueron dos:

90 1. Entropía general de la imagen

El estudio ha determinado que no es posible relacionar de forma coherente la entropía general de una imagen sin tratar con los intereses de cada usuario. Es decir, no puede inferirse los gustos de un usuario a partir de la entropía media de sus imágenes favoritas, por lo que su utilización se hace innecesaria en este caso.

2. Geometría de la imagen

El principal objetivo buscado con este análisis era el de determinar el eje de simetría (real o aproximado) de la imagen dada, para lo que se recurrió a diversos estudios previamente realizados. En los distintos artículos revisados, la geometría se analiza en imágenes muy concretas a partir de la segmentación de las mismas según regiones de interés, por lo que la problemática aumenta en el caso de imágenes naturales sin simetrías exactas.

Tal y como se explica en [56], existen dos métodos concretos para la detección de simetrías:

- Análisis del gradiente, óptimo para imágenes con un único objeto y simetrías bilaterales o rotacionales, por lo que su aplicación a las imágenes naturales no es recomendable.

- Análisis de la fase, aplicable en imágenes con más tipos de simetría. La principal característica de este método radica en que se encarga de detectar ejes de simetría unitarios y no genéricos, por lo que un estudio de la simetría genérica de la imagen sería imposible mediante su aplicación.

Los resultados obtenidos al aplicar el análisis de la fase (dado que es el método que puede proporcionar mejores resultados en imágenes cuyas simetrías no estén determinadas previamente) para la detección de simetrías de las imágenes tratadas no son relevantes, dado que se obtienen ejes de simetría unitarios, imposibilitando con ello su utilización para la detección de simetrías genéricas, tal y como se perseguía.

5.4 Modelo de extracción de características y anotación de

In document SARVA SHIKSHA ABHIYAN (SSA) (Page 91-94)