Recuperación de Información | Sistemas de Información y Documentación | Universidad de la Salle

U. de la Salle

Eres el visitante No.

Reproducir Video en Nueva Ventana

Mostrando entradas con la etiqueta Información. Mostrar todas las entradas
Mostrando entradas con la etiqueta Información. Mostrar todas las entradas

jueves, 16 de septiembre de 2010

COMPATIBILIDAD ENTRE SISTEMAS DE CLASIFICACIÓN EN DIRECTORIOS COMERCIALES: ESTÁNDARES Y SOLUCIONES TÉCNICAS

El uso de Internet como herramienta de promoción y como soporte de transacciones comerciales implica la necesidad de identificar información sobre posibles socios comerciales. Con este fin, se han diseñado distintos servicios de directorio, donde las organizaciones pueden dar a conocer su actividad y los productos y servicios que ofertan. A menudo, la descripción que ofrecen estos directorios consisten en breves
descripciones textuales facilitadas por las propias organizaciones, situación que condiciona al uso de sistemas de recuperación básicos, donde el usuario debe prever de antemano los términos utilizados en la descripción de las organizaciones registradas en estos directorios. Tanto los servicios comerciales como los servicios públicos para la distribución y localización de información sobre empresas, precisan de sistemas de
recuperación más sofisticados.
La aplicación de sistemas de clasificación basados en categorías preestablecidas y en el uso de términos controlados ofrece distintas ventajas, entre ellas garantizar la descripción homogénea de los servicios y facilitar al usuario la selección de categorías correctas a la hora de formular sus búsquedas. Por otra parte, los sistemas de clasificación incorporan notaciones para representar clases de forma abreviada e independiente de cualquier idioma en particular, lo que ayuda enormemente en la formulación de consultas en entornos globales donde los usuarios pueden proceder de distintas localizaciones geográficas.


Universidad Carlos III de Madrid, Biblioteconomía y Documentación,
C/ Madrid, 126 - 28903 Getafe España, reito@bib.uc3m.es

miércoles, 15 de septiembre de 2010

Búsqueda y Recuperación de Información: Perpestivas Teóricas


I.0.1 EL PROCESO DE BÚSQUEDA DE INFORMACIÓN
El estudio de los Sistemas de Recuperación de Información debería comenzar según ROBERTSON por plantear la cuestión de dónde situar los límites de ese Sistema. De hecho, las diferencias que existen a la hora de emplazar esos límites han dado origen a las 2 corrientes teóricas fundamentales en esta área, que son:
·         La perspectiva centrada en el Sistema.
·         La perspectiva centrada en el Usuario.
El proceso de búsqueda y recuperación de información ha sido analizado como un proceso de comunicación informal, como un proceso de resolución de problemas en el que intervienen varios factores.
Por una parte tenemos una persona que busca información porque tiene un problema o necesidad informativa.
Otro factor es el Sistema de búsqueda, donde se incluyen las técnicas para la recuperación de la información, documentos, representaciones de los documentos y la organización de esas representaciones.
El conjunto de resultados que se obtienen del Sistema y que debe satisfacer la necesidad de información del usuario.
Todos estos elementos influyen en el resultado final de recuperación o búsqueda e interactúan entre ellos. Sin embargo la investigación se ha centrado exclusivamente en uno de esos factores, en el Sistema de búsqueda.
Esta situación ha cambiado a partir de los años 80 con la incorporación de modelos cognitivos al análisis de procesos de recuperación de la información.
Este cambio ha provocado que la investigación se preocupe por cuestiones como: “como surge la -------------- , problemas encuentran los usuarios para ¿recibir o definir? esa necesidad de información, que estrategias se desarrollan para satisfacerla...
Desde esta perspectiva integradora se han desarrollado varios modelos teóricos del proceso de búsqueda que van a influir directamente en el diseño de los Sistemas de Recuperación de Información.
El 1ª que vamos a ver:
Modelo de SARACEVIC (1996): Integra 7 elementos distintos, que abarca el propio Sistema de Recuperación de Información y un Interfaz a través de la cual dialoga con el usuario.
Integra también todos los factores relacionados con el usuario. La interacción en este caso se realiza mediante el enunciado de búsqueda.
Esa interacción se realiza en 3 niveles:
·  Nivel de Superficie.
·  Nivel Cognitivo.
·  Nivel de Situación.
·  En el nivel de superficie, el usuario interactúa con el Sistema, mediante una interfaz, utilizando órdenes, preguntas, enunciados de búsqueda, que representan de alguna manera el planteamiento de un problema.
En el mismo nivel el Sistema responde con información que puede ser documentos o metainformación (representación de documentos), que en teoría diseñó satisfacer la necesidad o resolver el problema del usuario.
·  En el nivel cognitivo, el usuario interactúa con la respuesta del Sistema para evaluar su utilidad en relación con el problema inicial.
·  En el nivel de situación, que es el peor definido por SARACEVI, el usuario interactúa con el problema que se trae entre manos y producido por la necesidad de información, intentando aplicar el resultado de la búsqueda a la resolución del problema.
Modelo de INGWERSEN (1992): es el modelo integrador. Este integra aportaciones de la obra de BELKIN y también de VICKERY (1982-85).
El proceso de búsqueda se divide en 10 etapas agrupadas en 3 fases:
o    Fase de pre-búsqueda en esta a su vez tiene 3 etapas:
·         Etapa en la que el usuario reconoce que tiene un problema de información y que necesita solucionar.
·         El usuario reconoce que no tiene conocimientos necesarios para solucionar ese problema. Reconoce que su estado de conocimiento es inadecuado (anómalo) para solucinarlo. Es una aportación de Belkin. Todo proceso de búsqueda se inicia con lo que él denomina ESTADO ANÓMALO DEL CONOCIMIENTO (ASK).
·         Intenta resolverlo mediante búsqueda de información en un sistema.
Siguen muchos problemas: como un usuario que no sabe lo que quiere, expresa su necesidad de información...
o    Fase de búsqueda propiamente dicha Se inicia con una etapa de interacción con un intermediario, que puede ser una persona. La interacción se realiza con un Sistema informático. Esta interacción tiene como objetivo la definición de la necesidad de información.
- La siguiente etapa sería la formulación de la estrategia de búsqueda, en los términos aceptados por el Sistema con el que se ha interactuado.
- Siguiente etapa, la actividad de búsqueda.
- Siguiente etapa, la evaluación inicial de los resultados, que puede tener como resultado la reformulación del problema, de la estrategia y del enunciado de búsqueda. Esta etapa es muy importante porque introduce el concepto de RETROALIMENTACIÓN.
- En función de unos resultados obtenidos, el usuario y el Sistema reformulan la búsqueda.
• Fase de Post-Búsqueda En la que se evalúa la información recuperada en función de las necesidades y se utiliza la información.
Viendo estos 2 modelos, la situación habitual en la que un usuario interactúa con un Sistema de información, es que ese usuario se acerque a ese Sistema, sin tener muy claro que es lo que quiere o como mínimo sin tener muy claro como expresarlo.
Estas condiciones deberían tenerse en cuenta en el Diseño de Sistemas de Recuperación de Información. Sin embargo eso no es lo más frecuente. Lo más frecuente es que los Sistemas estén pensados para resolver lo que los ingleses llaman QUERY, lo que nosotros llamamos BÚSQUEDAS ANALÍTICAS Para responder a búsquedas que se han planteado conociendo minimamente la terminología y sintaxis que usa el Sistema.
La mayor parte de los Sistemas de Recuperación están preparados para comparar los términos usados con el índice del Sistema.
Para poder plantear esa búsqueda analítica, el usuario necesita tener un modelo mental del Sistema con el que está trabajando o con el que interactúa: qué información tiene, cómo está organizada, qué índices, qué términos y sintaxis.
La evidencia de lo complejo de esta situación ha favorecido la aparición de Sistemas que permiten una búsqueda más dinámica de carácter exploratorio denominada BROWSING BÚSQUEDA EXPLORATORIA (Traducido).
En este tipo de búsquedas el usuario no necesita formular un enunciado de búsqueda. Lo que hace es seleccionar información de lo que el Sistema le presenta. Se ojea, visualiza y se selecciona.
Este tipo de Sistemas descarga el esfuerzo cognitivo que tiene que realizar el usuario porque sólo tiene que reconocer la información que va a solucionar su problema y no tiene que describirla.
2º día esther.....
PERSPECTIVAS TEÓRICAS DE LOS SISTEMAS DE RECUPERACIÓN DE INFORMACIÓN
Las líneas de investigación fundamentales de los sistemas de búsqueda se dividen en función de la implantación que se de a los diferentes elementos que intervienen en el proceso de búsqueda o según Robertson en función de dónde se ponen los límites del sistema . encontramos dos enfoques:
·         Enfoque o perspectiva basada en el sistema o enfoque tradicional algorítmica o fisicalista.
Para esta perspectiva el sistema de recuperación de la información se limita al mecanismo que permita almacenar y la recuperación de la información . Existe una entrada de búsqueda y una salida de documentos que es la información.
Aquí la investigación se centra en los problemas relacionados con representación de documentos y con la equiparación de esta representación y equiparación.
Un concepto implante es:
RELEVANCIA: se define como la medida en q un conjunto de documentos recuperados se ajustan al objetivo de búsqueda. Se utiliza para evaluar los sistemas de búsqueda de recuperación de información.
La relevancia es objetiva en esta perspectiva. Lo que mide el ajuste entre el tema del documento y el de búsqueda pensando que existe una relación objetiva entre ellos.
Algunos autores de la perspectiva centrada en el sistema son: SALTON, SPACK SONES, ROBERTSON Y SIJSBERGEN.
SALTON: el núcleo de esta perspectiva son los TREC TEXT RETRIEVAL CONFER.
Conferencias sobre la recuperación de información, SRI, celebrada en EEUU donde se estudian los sistemas de recuperación de información.
·         La otra línea de investigación: la perspectiva centrada en el usuario u cognitiva trata de abarcar los elementos que influyen en el proceso de búsqueda con la incorporación del usuario y del entorno en el que se produce esa búsqueda.
Si se quiere diseñar sistemas eficaces es necesario conocer las características contextuales individuales que se influyen en la formalización de los resultados obtenidos.
El objeto de esta perspectiva es el cómo adecuar los SRI., las recuperaciones, las características de los usuarios finales y a los necesidades de un proceso interactivo.
Esta perspectiva se interesa por actualizar las condiciones de cómo surgen las necesidades de información y como influye esas condiciones en el proceso de búsqueda.
También investiga la influencia de las características individuales de los usuarios. Ejemplo: sexo edad, conocimiento de la materia, experiencia con ordenadores...cómo influyen en el proceso de búsqueda y la eficacia de búsqueda de resultados.
También analiza cómo se desarrolla ese proceso, la interacción, cómo va cambiando el proceso de búsqueda, e incluso la propia información durante ese proceso.
Aunque es frecuente que se denomina centrada en el usuario a cognitiva, hay una tendencia a reconocer que hay una perspectiva centrada en el usuario dentro de la cual hay una orientación cognitiva que se preocupa sobre todo por el desarrollo del proceso de búsqueda.
En palabras de INGWERSEN la orientación cognitiva tiene el fin de entender como las categorías de los modelos conceptuales de los usuarios afectan al modelo de búsqueda y se modifican durante ese proceso. Respecto al concepto de relevancia, para esa perspectiva, esta es la primera relevancia conceptual o de situación: es la primera subjetiva que trata de valorar la utilidad de documentos recuperados para el usuario que plantea la búsqueda (un documento es útil dependiendo de varios factores. EJ idiomas, que se conozca el documento...
BELKIN, ELLIS, BORGMAN Y BATES son otros autores sobre esto.
Sistemas de recuperación de información.
Es una expresión que tiene muchos equivalentes ( recuperación de información).
·         Recuperación automatizando información es un equivalente.
·         Almacenamiento y recuperación de información.
·         Sistema de almacenamiento y RI.
·         Sistemas de almacenamiento, conservación y RI: SACRI
Recuperación de documentos: no es una equivalencia muy habitual pero si en las décadas de los 80. esto pasa también con:
·         Recuperación de texto:
o    Texto libre
o    Texto concepto: sigue siendo la principal orientación de los SRI. Aunque actualmente se comienza a trabajar mucho con imagen y sonido.
Las definiciones delos SRI se establecen a partir de las diferencias entre RI y R de datos. Se hace esta diferencia en 4 aspectos, y que los emplea BLAIR sintetizando las 8 variantes que usa RISBERGEN:
·  Tipo de respuesta que recibe el usuario.
·  Relación entre la petición formal y la satisfacción del demandante de informa.
·  Criterio de éxito de la recuperación.
·  Velocidad de la recuperación con éxito.
Los SRI se diferencian de los datos porque los primeros surgen por las debilidades de los sistemas de datos para gestionar la información textual.
DIFERENCIAS
·         TIPO DE RESPUESTA QUE RECIBE EL USUARIO:
o    Recuperación de datos:
Recuperación directamente que responde a la pregunta del usuario y que deben responder a la pregunta directa.
La pregunta típica es específica “ quiero saber X”.
o    Recuperación de información:
Responde con la recuperación o respuesta indirecta que dirige al usuario a un conjunto de documentos que probablemente contendrán la información que necesitan.
La pregunta que se hace a estos sistemas, la primera es poco específica y de carácter general: “quiero saber” acerca de X”
Recibe una respuesta probabilística.
·         RELACIÓN ENTRE LA PETICIÓN FORMAL Y LA SATISFACCIÓN DEL DEMANDANTE DE INFORMACIÓN.
o    Recuperación de datos:
La relación necesaria entre una petición bien construida y la respuesta correcta.
o    Recuperación de información:
La recuperación probabilística entre una petición bien construida y una respuesta que puede ser o no satisfactoria.
·         CRITERIO DEL ÉXITO DE LA RECUPERACIÓN.
o    Recuperación de datos:
El criterio de éxito es la corrección de la respuesta y sobre todo la q se puede hacer una evaluación objetiva.
o    Recuperación de la información:
El criterio del éxito es subjetivo porque definitivamente depende de la utilidad que la información recuperada tenga para el usuario.
·         VELOCIDAD DE RECUPERACIÓN CON ÉXITO.
o    Recuperación de datos:
La velocidad de recuperación con éxito depende fundamentalmente de la velocidad física de acceso del sistema que se está usando.
o    Recuperación de información:
La velocidad de recuperación con éxito depende del número de decisiones lógicas que se deban tomar al realizar la búsqueda (tiempo que se tarda en crear la búsqueda, su posible reformulación, análisis, resultados).
21 octubre 2002-11-02
Características de los sistemas de recuperación de información.
Los sistemas de recuperación de información, también llamados sistemas de gestión documental, son uno de los modelos de los sistemas de información automatizada, concretamente, dentro de estos sistemas de información automatizada, son el modelo orientado a la gestión de información textual desestructurada.
Fueron pensados con el objetivo de superar las limitaciones que presentaban los sistemas de gestión de bases de datos.
Los imperativos del modelo de datos relacional especialmente la NO admisión de grupos repetidos o atributos multivaluados y las exigencias de un modelo muy normalizado obligan a la descomposición de un objeto en un conjunto de relaciones.
El modelo relacional exige para cualquier modelo de información, que existan una serie de campos para representar esa información, así creamos una estructura compleja de relaciones entre las diferentes informaciones.
La existencia de los campos o atributos repetitivos o multivaluados, significa que nosotros tendríamos que repetir una entrada de registro para cada uno de los valores que aparezca repetido.
En una base de datos relacional descomponemos la información en diferentes tablas que se relacionan entre si (por lo cual descomponemos el objeto) en las que aparecen los valores que se repiten y el identificante.
La información se divide en diferentes tablas que se reúnen mediante la interrogación que se hace mediante SQL.
Los sistemas de recuperación de información son concebidos para representar documentos o conjuntos de informaciones que no tienen ningún tipo de estructura o que tienen algún tipo de estructura formal en la que el valor de cada elemento carácter puede ser variable, tanto en el número de ocurrencias, como en su longitud y ya no tanto en la información que contiene.
También fueron concebidos para facilitar el acceso a documentos por múltiples vías o puntos de acceso, fundamentalmente para ceda una de las palabras que contiene.
Podemos definir estros sistemas como sistemas automatizados cuyo objetivo es la recuperación de documentos que contengan información relevante para satisfacer las necesidades del usuario expresadas mediante una estrategia de búsqueda.
Todo sistema de recuperación de información realiza dos tareas básicas:
•Representación
•Búsqueda
Se debe entender por REPRESENTACÓN el proceso mediante el cual el sistema transforma un documento previamente almacenado a la ecuación, enunciado de búsqueda del usuario en entradas de índice, en puntos de acceso que pretenden representar por un lado la información que contiene el documento, y por otro la necesidad de información del usuario.
La BÚSQUEDA en sistema de recuperación de información es el proceso mediante el cual el sistema examina las representaciones de los documentos y las compara o equipara con las representación de las consulta.
La finalidad de este proceso es determinar qué representación de los documentos coinciden con la búsqueda o son más similares.
Características de los sistemas de recuperación de información:
•Cómo se almacena la información
•
•Estructura de los datos
•Técnicas de comparación
•Facilidades de interacción con el usuario
La organización de la información documental en los sistemas de recuperación de información parten del principio de que la información que tiene que tratar el sistema de información se procesa a partir de documentos, entendidos estos documentos como frecuencias más o menos extremas de caracteres que se agrupan firmando palabras, que a su vez forman frases, párrafos o campos de información que en un números variable componen los documentos.
A pesar de que en principio estos sistemas se crean para trabajar con información estructurada . Esto hay que entenderlo de forma relativa ye que los documentos de los SRI siempre tienen algún tipo de estructura formal interna.
Inicialmente los SRI fueron diseñados para ser usados con información bibliográfica que sustituyen a loa documentos originales de forma que si usamos referencias bibliográficas tanto la representación como la búsqueda que hace el SRI se realiza sobre documentos secundarios.
Con el paso del tiempo se abarató el coste de almacenamiento de la información electrónica y se empieza a considerar habitual el almacenamiento y por tanto la recuperación del texto completo de los documentos.
Actualmente conviven las dos posibilidades y los SRI pueden trabajar tanto con representaciones como con documentos originales.
Las representaciones de los documentos originales se denominan desde hace unos años METAINFORMACIONES y pueden ser registros bibliográficos formalizados mediante formato MARC, pueden ser también registros de una base de datos con información estructurada en campos y también pueden ser representaciones de los documentos que en un principio se consideró la información más desestructurada que son documentos en formato html.
(La iniciación de formalización de etiquetas meta: METADATA ELEMENT SET es la de DUBLÍN CORE)
Aunque se trabaje con el texto completo del documento tampoco podemos hablar de documentación completamente estructurada ya que ningún documento electrónico tiene una_____________________________???????
Esta definición puede estar simplemente destinada a la presentación formal de los documentos, puede ser una estructuras en la que solo se estructura la información necesaria.
También la estructura puede estar orientada a realizar una descripción formal del contenido de los documentos, en este caso, se indicará cuál es el autor del documento, título y la información que contenga se estructura normalmente de forma jerárquica.
Este tipo de marcado es el que realizan lenguajes como: sgml, html, xml.
____________?????????????????????________________(falta algo??????)
Esta estructura cuando trabajamos con representaciones de los documentos, habitualmente, permite identificar distintas partes del registro que almacena en conjunto la información.
Hay varias soluciones para almacenar estas estructuras de registro variable:
•Una posibilidad es que con el inicio de cada nuevo campo se almacena una etiqueta que lo identifica y además existen unas marcas que identifican tanto el final del campo como el final del registro:
!Fin de campo #
!Fin de registro "
Para facilitar la recuperación de información y como los campos son de longitud variable, en algunos casos se incluyen también la información de longitud del campo.
•Una alternativa a este modelo consiste en guardar toda la información sobre la estructura del registro en un área diferenciada de datos propiamente dichos que habitualmente se denomina DIRECTORIO.
Esto es lo que se hace con los registros en formato Marc.
Cuanto mayor información tengamos sobre el registro mayor precisión podemos tener a la hora de definir los índices del sistema y por lo tanto mayor precisión a la hora de la recuperación.
La estructura de datos para el acceso a la información.
Los sistemas de gestión de datos de Bases de datos documentales mantienen una estructura determinadas para facilitar el acceso a la documentación que contiene el fichero de texto de forma no secuencial.
Habitualmente, suelen ofrecer difíciles métodos de indización y acceso ala información.
Esta flexibilidad da muchas posibilidades a la hora de parametrizar los índices que van a facilitar el acceso sistema.
Ej: Campo materia del formato Marc
65008 $a Mujeres $x Situación Social $z Amdalucía
Los índices que podemos generar:
Índice de subcampo
Índice de palabras clave
Índice de materias que recoge la información de cada uno de los subcampos
Índice de materias de palabras clave
22 Octubre 2002
En cualquier caso todos estos sistemas elaboran índices o estructuras de acceso a los documentos a partir de las palabras que contienen.
Este proceso se denomina habitualmente INDIZACIÓN AUTOMÁTICA MEDIANTE PALABRAS CLAVE.
Por medio de esta indización automática por palabras clave, se genera un fichero inverso, que es un índice que contendrá la relación alfabética de todos los términos contenidos en los campos indizables del fichero texto más la información posicional correspondiente.
Cuando el usuario introduce un término de búsqueda, el sistema de recuperación accede al fichero inverso para localizar ese término y recoger la información posicional.
Como el tamaño de los registros del fichero de texto es variable, esta información posicional del fichero inverso, si la información posicional del fichero inverso remite al fichero índice de texto que es donde tenemos la información de la localización del documento.
1.La información sobre la posición del término.
2.Los términos que podemos seleccionar
1. La información sobre la posición del término que se especifica en el fichero inverso va a condicionar las posibilidades de recuperación Si solamente incluimos el número del documento, solamente podemos indicar al sistema que los términos de búsqueda están en un solo documento nada más.
Si queremos que se puedan realizar búsquedas más precisas tenemos que incluir más información sobre la posición del término.
2. Términos que se incluyen en el índice, en principio cualquier palabra que aparezca en un documento almacenado en el sistema puede servir para representar su contenido, es decir, puede servir como punto de acceso o entrada de un índice.
En la práctica se realiza un proceso de selección para eliminar términos no significativos y reducir el ruido documental en la recuperación.
Este proceso de selección puede ser más o menos exhaustivo y puede afectar simplemente a la eliminación de palabras vacías, pero también puede afectar a la normalización de formas flexionadas o derivadas.
"Eliminación de palabras vacías
"Normalización de los singulares y plurales
"Normalización de femeninos y masculinos
"Normalización de tiempos verbales
"Normalización de prefijos y sufijos
Cuando se realiza algún tipo de normalización se puede adoptar al menos dos soluciones para gestionar las búsquedas, es decir, comparar los términos de los usuarios con los normalizados.
1.- Someter el enunciado de búsqueda al mismo proceso de normalización que a los términos del índice.
2.- Mantener un fichero diccionario en el que se conserva la información sobre todos los términos (tanto los normalizados como los que no) que puede utilizar el usuario, y desde este fichero diccionario remitir al inverso en el que solo se almacena información sobre los documentos que contiene el término normalizado.
1.2.3.técnicas de equiparación.
Los índices de estructura de datos de un SRI, permiten realizar operaciones de búsqueda mediante técnicas que equiparan los enunciados que han usado los usuarios con los términos almacenados en los índices del sistema.
- Estas técnicas permiten recuperar o realizar búsquedas de documentos que contengan uno o varios términos sin importar en qué campo o parte del texto.
- Búsquedas de documentos que contengan uno o varios términos en un campo o subcampo concreto (en un párrafo o frase)
- Búsquedas por uno o varios términos con truncamientos.
El uso de uno u otros dependerá de la forma en la que tengamos estructurada la información.
La clasificación tradicional de las técnicas de equiparación empleadas, se realiza en función del grado de coincidencia entre la búsqueda y los términos del índice que exigen esas técnicas para que se recuperen los documentos.
En función de este criterio se distingue entre:
·  Técnicas de equiparación exacta
·  Técnicas de equiparación parcial
a)Técnicas de equiparación exacta! los documentos solo se recuperan cuando cumplen todas las condiciones del enunciado de búsqueda.
Ej: Ríos Y Riberas Y España ! Debe incluir todos los términos de búsqueda
Ríos O Riberas O España
Producen muchos silencios documentales si usamos el operador “Y” y mucho ruido documenta si usamos “O”.
b)Técnicas de equiparación parcial Permiten recuperar documentos en función de su similitud con el planteamiento de búsqueda y no de la coincidencia total de los descriptores con los términos que aparecen en el documento.
Eliminan la necesidad de usar operadores boléanos.
Para facilitar la selección de información los documentos recuperados se ordenan en función de su relevancia respecto de la búsqueda, relevancia que está determinada por el grado de coincidencia con el enunciado de búsqueda.
Mejoras en la interacción con el usuario.
Al mismo tiempo que se mejoraban las técnicas de equiparación, la investigación sobre la experiencia de usuarios reales demostraba que para esto incluso era cuestionable el sistema de búsqueda por equiparación, porque con frecuencia el problema es que no tienen los recursos necesarios para convertir su carencia o necesidad de información en una pregunta formal a un SRI.
Para mejorar la interacción en cualquier tipo de búsqueda los SRI han ido incorporando diferentes herramientas que mejoran tanto la equiparación, como las búsquedas exploratorias.
Los estudios empíricos han demostrado que entre un 7%-10% de las búsquedas fallan porque incluyen este tipo de errores, de manera que las técnicas que se han desarrollado para conseguirlos permiten mejorar la equiparación, coincidencia con los índices.
El resto de mejoras van orientadas a facilitar las búsquedas exploratorias (BROWSING).
- Visualización de índices alfabéticos y sistemáticos que deberían permitir al usuario hacerse una idea de la información que puede encontrar en el sistema, además de llevar al usuario desde el término que ha utilizado hasta el admitido como punto de acceso y también encontrar términos de búsqueda en los que previamente no había pensado.
- Visualización de registros en diferentas formatos el objetivo es que el usuario tenga información suficiente sobre el documento para facilitar los juicios de relevancia (si el documento le interesa o no) y también para facilitar la potencial selección de nuevos términos de búsqueda.
- Otra herramienta incorporada son los enlaces hipertextuales entre registros-enlaces que permiten visualizar registros que comparten la información de los campos que son puntos de acceso normalmente.
- Modificación de las búsquedas mediante técnicas de retroalimentación por relevancia (relevance feedback) técnicas que permiten recuperar automáticamente documentos similares al que un usuario ha considerado relevante.
Presentación de información a los usuarios mediante interfaces gráficas y metáforas de la biblioteca Representaciones de la biblioteca o información que contiene el sistema que trata de aclarar la forma en la que está organizada la información.

http://html.rincondelvago.com/busqueda-y-recuperacion-de-la-informacion.html

Principales medidas de evaluación en r.i.


Una vez definido el concepto de relevancia y relacionando éste con si un documento es recuperado o no, podemos establecer una serie de medidas que nos servirán para evaluar los sistemas de recuperación. A continuación expondremos las principales medidas comunes a todos lo modelos de recuperación.
Los documentos pueden ser recuperados o rechazados al establecer la comparación entre la pregunta y la base de datos. El conjunto de documentos recuperados se divide, salvo en los sistemas perfectos, en dos grupos: documentos relevantes recuperados, es decir aquellos que se han recuperados correctamente y los no relevantes, recuperados erróneamente que provocan ruido en la salida. Los documentos no recuperados, que a su vez se dividen en los relevantes, rechazados por el sistema de manera errónea y los no relevantes, rechazados de manera correcta por el sistema. Esto mismo lo podemos ver en el siguiente dibujo.
Ilustración 1 Esquema recuperación documentos. Fuente:[Baeza-Yates 1999]

El cálculo de la relevancia

Existen dos métodos para calcular la relevancia, uno manual y otro conocido como polling :
  • Manual: consiste en la exploración de los documentos uno a uno para saber si se adecúan o no como respuesta a una pregunta. Muchas veces establecer la relevancia de un documento para una pregunta determinada resulta difícil y los especialistas no se ponen de acuerdo, por ello, es conveniente que los juicios los haga más de uno, y a ser posible un número impar de especialistas. El principal problema que presenta este método, es que en colecciones muy grandes, hay que invertir gran cantidad de tiempo, lo que supone mucho dinero para realizar esta operación y esto no siempre es posible. Además, algunas bases de datos son más especializadas que otras, lo que hace necesario contar con un número mayor o menor de especialistas. Para solventar estos problemas se crean las colecciones experimentales, donde se fija de antemano qué documentos son relevantes para cada pregunta.
    Estas colecciones suelen tener un tamaño medio y suelen pertenecer a una misma área temática o muy próxima para que no sea necesaria la intervención de muchos especialistas.Un ejemplo de una colección manual es la de Crandfield [Cleverdon 91]. En este caso se buscaron los artículos y se les pidió a los autores que elaboraran preguntas cuya respuesta fuera su artículo y también se les pidió que citaran otros artículos que correspondieran a esa misma pregunta que ellos habían formulado. Con las preguntas y los artículos citados por los autores se elaboró la base de datos, la colección de preguntas, y los juicios de relevancia.
  • Polling : cuando las bases de datos son muy grandes, y no es posible evaluar uno a uno los documentos, para determinar cuáles son los documentos relevantes, se recurre al "polling". Lo que se hace es analizar de manera manual un número determinado de documentos recuperados con distintos sistemas, este número suele ser elevado (varios centenares) y se corresponde con los primeros documentos recuperados con cada sistema. Este conjunto de documentos es el que de manera manual analizan los expertos, que son los encargados de decir en último término si son relevantes o no. Este sistema asume que la gran mayoría de los documentos relevantes son encontrados, si no por todos los sistemas, sí al menos por alguno de ellos, y los no recuperados pueden considerarse como no relevantes Kowalski 97].
    De esta manera no es necesario evaluar toda la base de datos, pero aún así el sistema es fiable ya que el número de documentos que se suele examinar es elevado. Este sistema es el que se viene utilizando en las TREC desde 1994 [Harman 95].




    http://www.hipertext.net/web/pag238.htm#La%20relevancia

La relevancia


Uno de los principales problemas en R.I. es la variedad de interpretaciones de algunos conceptos, como es el caso del de relevancia [Mizzaro 98].
Es importante definir este concepto, porque está en la base del resto de las medidas que tradicionalmente se vienen aplicando en R.I.. Aunque se formuló entre los años 30-40 no se utilizó experimentalmente hasta el test de Crandfield.
El concepto de relevancia se ha estudiado desde distintos puntos de vista [Saracevic 97] : lógica, filosofía, psicología, semantica, documentación... Estos enfoques los podemos resumir en dos tendencias: la relevancia objetiva y la subjetiva. La primera hace hincapié en los sistemas, normalmente define cómo la materia de la información recuperada coincide con la de la pregunta. La subjetiva, es la que tiene en cuenta al usuario [Swanson 86]. Dentro de este enfoque está la relevancia mirada desde el punto de vista del usuario [Schamber 90], [Wilson 73]. Para Schamber la relevancia se refiere a la utilidad, o potencial uso de los materiales recuperados, con relación a la satisfacción de los objetivos, el interés, el trabajo o los problemas intrínsecos del usuario.
En la relevancia subjetiva, se estudia desde el punto de vista de la información nueva que consigue un usuario de un documento. Según este concepto, la información conocida no es relevante [Boyce 92]. Hay autores a caballo entre estas dos tendencias, para los que la relevancia tiene un componente objetivo y otro subjetivo. Así Barry [Barry 94], determina la relevancia de un documento en función de siete criterios (1. Información que contiene un documento; 2 experiencia previa del usuario; 3 creencias y preferencias del usuario; 4 otras informaciones y fuentes; 5 fuentes del documento; 6 documento como entidad física; 7 situación de los usuarios) de los cuales dos son objetivos (1 y 5) y cinco subjetivos (2, 3, 4, 6 y 7).
Harter [Harter 96] indica que el principal problema de los estudios sobre los factores que afectan a la relevancia es que se han hecho de manera intuitiva, tal vez esto sea debido la variedad de interpretaciones de este término.
Muy ligado al concepto de relevancia está el de pertinencia; con frecuencia se entremezclan y confunden. Según Korfhage [Korfhage 97], relevancia es la medida de cómo una pregunta se ajusta a un documento , (esta visión coincide con el enfoque de la relevancia objetiva) y pertinencia es la medida de cómo un documento se ajusta a una necesidad informativa (lo que otros autores definen como relevancia subjetiva).
Es decir, según este autor, la diferencia entre uno y otro radica en cómo expresamos la necesidad de información, por lo tanto, a la hora de establecer la relevancia tenemos que tener en cuenta la doble dificultad que lleva implícita la pregunta, porque tiene que ser el reflejo de la necesidad informativa (de ella dependerá la pertinencia) y al mismo tiempo tiene que ser adecuada para la búsqueda de los documentos que resuelvan la necesidad informativa, ya que la relevancia va a depender directamente de la formulación concreta de la demanda informativa. A pesar de que Korfhage establece esta distinción entre relevancia (relevancia objetiva) y pertinencia (relevancia subjetiva), no todos los autores siguen esta línea, sino que algunos los utilizan como sinónimos.
En el caso de los trabajos en español muchas veces se han traducido los dos términos indistintamente para referirse a los dos conceptos. La valoración de la pertinencia es mucho más difícil de realizar ya que es el propio usuario el único que sabe si un documento se ajusta a su necesidad o no. Además la pertinencia en un mismo usuario cambia de un momento a otro, ya que la información conocida no es pertinente, puesto que no resuelve la necesidad informativa.
Para calcular la relevancia, lo más habitual es establecer valores binarios: un documento es relevante, es decir, sirve como respuesta a nuestra pregunta, (valor 1) o no sirve (valor 0), aunque también se puede fijar una gradación, y establecer una escala ordinal para medir la relevancia de los documentos [Cuadra 67]. El problema de determinar una escala es que no hay una guía clara para elaborarla. Por ejemplo Keen [Keen 71], usa cuatro valores de escala, para dividir del más relevante al menos relevante. Saracevic [Saracevic] [88] da tres valores a su escala: relevante, parcialmente relevante y no relevante, pero en la práctica distinguir entre un documento relevante y uno parcialmente relevante es muy difícil.

http://www.hipertext.net/web/pag238.htm#La%20relevancia

lunes, 13 de septiembre de 2010

Gestor de Información

En el día a día de los archivos, se puede afirmar sin temor a exageración, la recuperación de la información ha sido y sigue siendo una de las principales áreas del quehacer diario del archivero. ¿Qué ha hecho y sigue haciendo sino el archivero todos los días en su archivo? Poner la información a disposición de los que la necesitan. Todas las funciones del archivo (la conservación, la descripción,...) tienen como objetivo final la consulta de información.
El archivero, como gestor de información, no puede tener en cuenta la posibilidad de la descripción de documentación de archivo y la posterior recuperación de esta información si no es por medio de la utilización de recursos informáticos. La capacidad de tratamiento de masas de información que de otra manera no son aprehensibles de forma inmediata, la rapidez en la localización de dicha información, las posibilidades de un tratamiento y una mejora continuada de la información que se hace llegar a los usuarios, se convierten en razones determinantes para tener que utilizar estos medios. La informática no es la razón de ser del trabajo del archivo, pero es la herramienta sine qua non.
Por el contrario –creo que no debemos de olvidarlo nunca– de la experiencia acumulada hasta la actualidad parece que se puede colegir el que, más que un cambio de la función de tratamiento de la información en sí, lo que está cambiando son los medios, la forma de hacer el trabajo diario. El archivero al describir fondos de archivo interpreta, y en la medida en que su trabajo es de interpretación, este no es sustituible por medios totalmente automáticos. Es cuando finalizado este proceso de interpretación cuando los medios informáticos le ayudan a él, y a sus usuarios, a recuperar la información que ha generado. La utilización de medios informáticos en el tratamiento de la información de archivo no da mayor valor añadido al trabajo de descripción en sí, que será bueno o malo en la medida en la que el archivero sepa reflejar el contenido y el contexto del documento, pero mejora de manera evidente las posibilidades de explotación de ese valor añadido. Acudiendo a un análisis económico clásico, “producir” cualquier cosa exige saber y hacer bien el trabajo, y luego saber servirlo, el análisis de la recuperación de la información nos enseña a servir; saber y hacer bien el trabajo es otra cosa. La principal idea que se pretende transmitir en este artículo es, pues, que el proceso de tratamiento de la información de archivo se puede resumir como el proceso de suma de un activo intelectual a la información “bruta” de los documentos, y que esta suma está directamente condicionada por el método por el cual se transmite, y por la capacidad del usuario de extraerle el mayor provecho posible. El análisis detallado del modo de transmisión de la información, y de la cantidad y calidad de la información que llega al usuario es la razón de ser del análisis de la recuperación de la información en los archivos. Ni que decir tiene que, desde mi punto de vista, el análisis de los métodos y los resultados relacionados con la recuperación de la información en los archivos deben ser básicos en el trabajo de los archiveros. Cómo hacer que este activo intelectual que proporciona el archivero se transmita al completo, sin pérdida de calidad, con la mayor facilidad, y siempre teniendo en cuenta las posibles necesidades de nuestros usuarios es uno de nuestros quehaceres fundamentales.

jueves, 26 de agosto de 2010

La indización


Indización es el procedimiento que produce entradas en un índice.
Indización es el proceso de análisis del contenido informativo de registros de conocimiento (documentos) y la expresión de ese contenido en el lenguaje del sistema correspondiente.
Indización es la operación que tiene como propósito representar los resultados del análisis documental de un documento por medio de términos extraidos de un lenguaje documental.
Se pueden apreciar dos ideas básicas:
  • El objetivo de la indización es representar (expresar, describir o indicar) el contenido (temas, características) de un documento.
  • El proceso de indización tiene dos componentes: (a) análisis de contenido para seleccionar los conceptos que representarán los documentos; y (b) traducción o expresión de los conceptos seleccionados en el lenguaje utilizado por el sistema.
Por lo tanto hay que estudiar primero de qué trata el documento para extraer los conceptos y aplicar una estrategia de indización que permita traducir los conceptos. Esta estrategia debe tener en cuenta los puntos siguientes:
  • Fuentes de procedencia de los términos: Tesauro, vocabularios, lenguaje natural.
  • Especificidad: ¿Cuán específico debe ser un indizador al traducir un concepto a un término índice? ¿Debe el término seleccionado ser tan específico como el concepto? o ¿debería utilizarse uno más amplio? Por ejemplo: Un documento trata sobre los perros de raza Cocker Spanniel, pero se puede pensar que este término es demasiado específico para el sistema y entra en el índice con el término Perro, más amplio. Evidentemente esto depende del sistema documental, porque si se tratara de una base de datos sobre perros el término de entrada adecuado sería el primero.
  • Ponderación: ¿Se puede expresar de alguna manera la importancia relativa de un concepto en un docuemento?
  • Precisión: ¿Qué grado de precisión debe tener la traducción? ¿Qué hacer cuando no hay un término adecuado?
  • Grado de coordinación: ¿Deben utilizarse términos simples o términos compuestos? Por ejemplo, el término Educación Infantil puede ser equivalente a la combinación de términos Educación e Infancia, cada uno de ellos por separado y combinables en la búsqueda.
  • Exhaustividad: ¿Todo debe ser indizado?.
Objetivos y funciones de un índice.
  1. Identificar y localizar información potencialmente relevante en el documento o la colección indizada.
  2. Discriminar entre información sobre un tema y simples menciones al tema.
  3. Excluir menciones al tema que no aporten nada significativo a un usuario potencial.
  4. Analizar los conceptos tratados en el documento para proponer encabezamientos (entradas) adecuados basados en su propia terminología.
  5. Indicar relaciones entre temas.
  6. Agrupar o reunir materiales separados en la colección.
  7. Organizar encabezamientos y subencabezamientos y modificadores en entradas del índice.
  8. Dirigir al usuario hacia términos válidos por medio de reenvíos del tipo USE o Véase.
  9. Sugerir al usuario de un tema que vea también otros por medio de reenvíos como Véase también.
  10. Organizar las entradas en un orden sistemático que ayude al usuario.
La operación de Indización.
La indización comporta las operaciones siguientes:
  • Planteamiento de objetivos: Contexto de trabajo.
  • Conocimiento del contenido del documento.
  • Elección de conceptos a representar: Selectividad (Retener aquellos conceptos sobre los cuales el documento aporta información susceptible de utilizar alusuario) Exhaustividad (Todos los conceptos útiles deben ser extraidos). El criterio principal de selección es el valor potencial del concepto escogido como elemento de expresión del tema del documento de cara a su recuperación.


Fenómeno: electricidad, lluvia ácida


Objeto: avión, trenes de cercanías


Documento legal: ley, sentencia


Materia: análisis documental, agricultura,
¿Qué?

estudio de..., cálculo de...



Arquitectónica: La Alhambra

Materia
Obra
Literaria: La Odisea
¿Cómo?


Pictórica: La rendición de Breda


Proceso: Envejecimiento de la población


Cualidad: esfuerzo, optimismo


Propiedad: Flexibilidad, endurecimiento


Materiales: Cuero, polietileno






Político: Napoleón


Personaje
Artístico: Jorge Luis Borges
¿Quién?
Personalidad

Ficticio: el Capitán Haddock


Entidad: el Atlético de Madrid; Zara





Día: 14 de abril de 1912
¿Cuándo?
Tiempo
Año: 1789


Siglo: XVI


Período: Holoceno, Años 60, 1936-1939





Continente: Asia


Conjunto de países: Mercosur


País: México


Estado o provincia: Baviera
¿Dónde?
Lugar
Ciudad: Siena


Barrio: Prosperidad


Calle: Corredera Alta de San Pablo


Río: Bidasoa


Cadena montañosa: Sierra Madre


Comarca: El Maresme


Mar: Mediterráneo





 
  • Verificación de la pertinencia de los conceptos extraidos.
  • Traducción de los conceptos escogidos al lenguaje documental del sistema. Los conceptos deberán traducirse por entradas del mismo nivel de especificidad o superior. Si el concepto es compuesto y existe la opción deberátraducirse por una entrada compuesta.
  • Verificación de la pertinencia de los términos obtenidos planteándolos como términos posibles de interrogación y valorando si el documento es pertinente.
  • Formalización de la descripción si el sistema prevé algún tipo de regla.
 
Tipología de índices:
Índices libres basados en palabras del texto: Son índices cuyas entradas están conformadas por palabras derivadas del texto mediante métodos extractivos. La tarea principal del analista es identificar las palabras candidatas a formar parte del índice.
  • Índices de documentos individuales
  • Índices de colecciones de documentos
  • Índices esquemáticos
  • Índices de palabras y nombres (concordancias)
  • Índices permutados KWIC, KWOC, KWAC
  • Índices de unitérminos (Taube)
  • Índices de citas
Índices controlados basados en conceptos. Proceso intelectual de análisis comprensión de contenidos y traducción a lenguaje documental. Requieren el uso de un tesauro u otro lenguaje documental.
Indización mediante descriptores.
El método de indización por descriptores se basa en la suposición de que los contenidos semánticos (las materias o temas) de un documento pueden expresarse con suficiente precisión por una palabra o conjunto de palabras que cumplen una función nominativa. Estas palabras-clave o descriptores actúan de forma independiente y pueden combinarse entre sí utilizando los operadores lógicos booleanos. Generalmente se ofrecen en sistemas poscoordinados y suelen utilizar un tesauro.
Operadores lógicos:
  • Intersección: la intersección de dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer a ambos conjuntos. Si tenemos el conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor LEGISLACION. La intersección entre ambos estará integrada por documentos que contienen ambos luego tratarán sobre Legislación cinematográfica. La intersección se suele expresar con los operadores siguientes:
CINE AND LEGISLACION
CINE Y LEGISLACION
  • Unión: La unión de dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer a uno, otro o a los dos. Si tenemos un conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor TEATRO, el resultado será un conjunto integrado por todos los documentos de Cine y todos los de Teatro. La unión se suele expresar con los operadores siguientes:
CINE OR TEATRO
CINE O TEATRO
  • Diferencia: La diferencia entre dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer al primero pero no al segundo. Si tenemos un conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor ESPAÑA el resultado será un conjunto integrado por todos los documentos de Cine, menos los de Cine español. La diferencia se suele expresar con los operadores siguientes:
CINE NOT ESPAÑA
CINE NO ESPAÑA

Los descriptores son palabras o grupos de palabras incluidas en un lenguaje documental y escogidas de entre un conjunto de términos equivalentes para representar sin ambigüedad una noción contenida en un documento o en una petición de búsqueda documental. (Véase también el tema de los Tesauros)
Descriptor unitérmino o simple: Descriptor que representa un concepto mediante una sola palabra: CINE, OCIO, HIERRO, AUTOMOVIL
Descriptor sintagmático o compuesto: Descriptor que representa un concepto utilizando más de una palabra (un sintagma nominal o preposicional): COMUNICACION SOCIAL, PARTIDOS POLITICOS, MEDIOS DE TRANSPORTE, EMPRESA PRIVADA.
Descriptor primario: Término o conjunto de términos que representan un concepto de manera unívoca. Es significativo, relevante y no hay posibilidad de ambigüedad en su sentido, pudiendo aparecer aislado sin necesidad de aclaración. Cualquiera de los citados en las categorías anteriores es así.
Descriptor secundario: Descriptor que necesita ir acompañado de otros descriptores para expresar un significado preciso: ANALISIS, EVALUACION, CONCEPTO, TEORIA.
Descriptor temático: Representa cualquier contenido disciplinar.
Descriptor geográfico: Representa todo tipo de conceptos vinculados con lugares y sitios.
Descriptor onomástico: Representa un nombre de persona o de institución.
Descriptor cronológico: Representa períodos de tiempo o fechas.


Licencia de Creative Commons
Manual de Alfresco by Claudia Marcela Torres is licensed under a Creative Commons Attribution-ShareAlike 2.5 Colombia License.
Based on a work at www.alfresco.com.
Permissions beyond the scope of this license may be available at http://creativecommons.org.