Recuperación de Información | Sistemas de Información y Documentación | Universidad de la Salle

U. de la Salle

Eres el visitante No.

Reproducir Video en Nueva Ventana

Mostrando entradas con la etiqueta Metadatos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Metadatos. Mostrar todas las entradas

jueves, 16 de septiembre de 2010

Lenguajes de interrogación y ecuaciones de búsqueda

    • Lenguajes
      Cada sistema de recuperación tiene su propio lenguaje de interrogación, que es el que le permite "hablar" en el mismo lenguaje que la base de datos. Este lenguaje como cualquier otro tiene sus propia sintaxis que especifica las características especiales de la búsqueda determinando en cada momento la relación que tienen los elementos de búsqueda. Las reglas gramaticales en el lenguaje de interrogación son los operadores.
    • Cómo plantear una estrategia de búsqueda
      No existen pautas que nos indiquen como hacer con exactitud todas las búsqueda debido a que cada consulta es distinta. Por eso es conveniente definir un procedimiento básico de trabajo:
      • Planteando el tema desde distintos puntos de vista
      • Determinando que se sabe del tema
      • Formulando nuestra búsqueda mediante:
        • La selección de palabras clave que representen lo que busco (utilizar diccionarios, sinónimos, tesauros, ontologías, etc.)
        • La traducción de las palabras importantes a otros idiomas (inglés)
      • Seleccionando las herramientas de búsqueda (índices, motores, metabuscadores). Se recomienda usar distintas herramientas a la vez.
      • Aplicando las palabras clave en las herramientas de búsqueda seleccionadas
    • Ecuaciones simples
      • Ecuaciones compuestas
        • Operadores
          • Lógicos o Boléanos: Permiten convertir las palabras de la consulta en conjuntos matemáticos, y operar con las palabras como si fuesen conjuntos. Las operaciones básicas son la suma (OR), la resta (NOT) y el producto (AND).
            • Y lógico (AND)
            • NO lógico (NOT)
            • O lógico (OR)
          • Posicionales: Permiten especificar la posición de las palabras dentro del documento.
            • Cerca (NEAR)
            • Junto (ADJ)
            • Frases
          • Existencia: Indica cuando se requiere la presencia o ausencia de una palabra en los documentos recuperados.
            • Presencia / Ausencia
            • Ausencia
          • Exactitud: Este tipo de operador se utiliza cuando la consulta que se pretende es menos específica ya que, permite la posibilidad de cortar una palabra de búsqueda a su raíz.
            • Proximidad
            • Por campos
        • CCL (Common Command Language)
        • Permite restringir las búsquedas mediante calificadores -es decir, la búsqueda se puede llevar a cabo en campos específicos como Autor, título, etc.- es muy utilizado en bases de datos. La característica de este sistema es que puede mezclar los dos lenguajes, calificadores y operadores lógicos, obteniendo de esta forma una búsqueda muy exhaustiva.
          http://www.mariapinto.es/e-coms/recu_infor.htm

        miércoles, 15 de septiembre de 2010

        Búsqueda y Recuperación de Información: Perpestivas Teóricas


        I.0.1 EL PROCESO DE BÚSQUEDA DE INFORMACIÓN
        El estudio de los Sistemas de Recuperación de Información debería comenzar según ROBERTSON por plantear la cuestión de dónde situar los límites de ese Sistema. De hecho, las diferencias que existen a la hora de emplazar esos límites han dado origen a las 2 corrientes teóricas fundamentales en esta área, que son:
        ·         La perspectiva centrada en el Sistema.
        ·         La perspectiva centrada en el Usuario.
        El proceso de búsqueda y recuperación de información ha sido analizado como un proceso de comunicación informal, como un proceso de resolución de problemas en el que intervienen varios factores.
        Por una parte tenemos una persona que busca información porque tiene un problema o necesidad informativa.
        Otro factor es el Sistema de búsqueda, donde se incluyen las técnicas para la recuperación de la información, documentos, representaciones de los documentos y la organización de esas representaciones.
        El conjunto de resultados que se obtienen del Sistema y que debe satisfacer la necesidad de información del usuario.
        Todos estos elementos influyen en el resultado final de recuperación o búsqueda e interactúan entre ellos. Sin embargo la investigación se ha centrado exclusivamente en uno de esos factores, en el Sistema de búsqueda.
        Esta situación ha cambiado a partir de los años 80 con la incorporación de modelos cognitivos al análisis de procesos de recuperación de la información.
        Este cambio ha provocado que la investigación se preocupe por cuestiones como: “como surge la -------------- , problemas encuentran los usuarios para ¿recibir o definir? esa necesidad de información, que estrategias se desarrollan para satisfacerla...
        Desde esta perspectiva integradora se han desarrollado varios modelos teóricos del proceso de búsqueda que van a influir directamente en el diseño de los Sistemas de Recuperación de Información.
        El 1ª que vamos a ver:
        Modelo de SARACEVIC (1996): Integra 7 elementos distintos, que abarca el propio Sistema de Recuperación de Información y un Interfaz a través de la cual dialoga con el usuario.
        Integra también todos los factores relacionados con el usuario. La interacción en este caso se realiza mediante el enunciado de búsqueda.
        Esa interacción se realiza en 3 niveles:
        ·  Nivel de Superficie.
        ·  Nivel Cognitivo.
        ·  Nivel de Situación.
        ·  En el nivel de superficie, el usuario interactúa con el Sistema, mediante una interfaz, utilizando órdenes, preguntas, enunciados de búsqueda, que representan de alguna manera el planteamiento de un problema.
        En el mismo nivel el Sistema responde con información que puede ser documentos o metainformación (representación de documentos), que en teoría diseñó satisfacer la necesidad o resolver el problema del usuario.
        ·  En el nivel cognitivo, el usuario interactúa con la respuesta del Sistema para evaluar su utilidad en relación con el problema inicial.
        ·  En el nivel de situación, que es el peor definido por SARACEVI, el usuario interactúa con el problema que se trae entre manos y producido por la necesidad de información, intentando aplicar el resultado de la búsqueda a la resolución del problema.
        Modelo de INGWERSEN (1992): es el modelo integrador. Este integra aportaciones de la obra de BELKIN y también de VICKERY (1982-85).
        El proceso de búsqueda se divide en 10 etapas agrupadas en 3 fases:
        o    Fase de pre-búsqueda en esta a su vez tiene 3 etapas:
        ·         Etapa en la que el usuario reconoce que tiene un problema de información y que necesita solucionar.
        ·         El usuario reconoce que no tiene conocimientos necesarios para solucionar ese problema. Reconoce que su estado de conocimiento es inadecuado (anómalo) para solucinarlo. Es una aportación de Belkin. Todo proceso de búsqueda se inicia con lo que él denomina ESTADO ANÓMALO DEL CONOCIMIENTO (ASK).
        ·         Intenta resolverlo mediante búsqueda de información en un sistema.
        Siguen muchos problemas: como un usuario que no sabe lo que quiere, expresa su necesidad de información...
        o    Fase de búsqueda propiamente dicha Se inicia con una etapa de interacción con un intermediario, que puede ser una persona. La interacción se realiza con un Sistema informático. Esta interacción tiene como objetivo la definición de la necesidad de información.
        - La siguiente etapa sería la formulación de la estrategia de búsqueda, en los términos aceptados por el Sistema con el que se ha interactuado.
        - Siguiente etapa, la actividad de búsqueda.
        - Siguiente etapa, la evaluación inicial de los resultados, que puede tener como resultado la reformulación del problema, de la estrategia y del enunciado de búsqueda. Esta etapa es muy importante porque introduce el concepto de RETROALIMENTACIÓN.
        - En función de unos resultados obtenidos, el usuario y el Sistema reformulan la búsqueda.
        • Fase de Post-Búsqueda En la que se evalúa la información recuperada en función de las necesidades y se utiliza la información.
        Viendo estos 2 modelos, la situación habitual en la que un usuario interactúa con un Sistema de información, es que ese usuario se acerque a ese Sistema, sin tener muy claro que es lo que quiere o como mínimo sin tener muy claro como expresarlo.
        Estas condiciones deberían tenerse en cuenta en el Diseño de Sistemas de Recuperación de Información. Sin embargo eso no es lo más frecuente. Lo más frecuente es que los Sistemas estén pensados para resolver lo que los ingleses llaman QUERY, lo que nosotros llamamos BÚSQUEDAS ANALÍTICAS Para responder a búsquedas que se han planteado conociendo minimamente la terminología y sintaxis que usa el Sistema.
        La mayor parte de los Sistemas de Recuperación están preparados para comparar los términos usados con el índice del Sistema.
        Para poder plantear esa búsqueda analítica, el usuario necesita tener un modelo mental del Sistema con el que está trabajando o con el que interactúa: qué información tiene, cómo está organizada, qué índices, qué términos y sintaxis.
        La evidencia de lo complejo de esta situación ha favorecido la aparición de Sistemas que permiten una búsqueda más dinámica de carácter exploratorio denominada BROWSING BÚSQUEDA EXPLORATORIA (Traducido).
        En este tipo de búsquedas el usuario no necesita formular un enunciado de búsqueda. Lo que hace es seleccionar información de lo que el Sistema le presenta. Se ojea, visualiza y se selecciona.
        Este tipo de Sistemas descarga el esfuerzo cognitivo que tiene que realizar el usuario porque sólo tiene que reconocer la información que va a solucionar su problema y no tiene que describirla.
        2º día esther.....
        PERSPECTIVAS TEÓRICAS DE LOS SISTEMAS DE RECUPERACIÓN DE INFORMACIÓN
        Las líneas de investigación fundamentales de los sistemas de búsqueda se dividen en función de la implantación que se de a los diferentes elementos que intervienen en el proceso de búsqueda o según Robertson en función de dónde se ponen los límites del sistema . encontramos dos enfoques:
        ·         Enfoque o perspectiva basada en el sistema o enfoque tradicional algorítmica o fisicalista.
        Para esta perspectiva el sistema de recuperación de la información se limita al mecanismo que permita almacenar y la recuperación de la información . Existe una entrada de búsqueda y una salida de documentos que es la información.
        Aquí la investigación se centra en los problemas relacionados con representación de documentos y con la equiparación de esta representación y equiparación.
        Un concepto implante es:
        RELEVANCIA: se define como la medida en q un conjunto de documentos recuperados se ajustan al objetivo de búsqueda. Se utiliza para evaluar los sistemas de búsqueda de recuperación de información.
        La relevancia es objetiva en esta perspectiva. Lo que mide el ajuste entre el tema del documento y el de búsqueda pensando que existe una relación objetiva entre ellos.
        Algunos autores de la perspectiva centrada en el sistema son: SALTON, SPACK SONES, ROBERTSON Y SIJSBERGEN.
        SALTON: el núcleo de esta perspectiva son los TREC TEXT RETRIEVAL CONFER.
        Conferencias sobre la recuperación de información, SRI, celebrada en EEUU donde se estudian los sistemas de recuperación de información.
        ·         La otra línea de investigación: la perspectiva centrada en el usuario u cognitiva trata de abarcar los elementos que influyen en el proceso de búsqueda con la incorporación del usuario y del entorno en el que se produce esa búsqueda.
        Si se quiere diseñar sistemas eficaces es necesario conocer las características contextuales individuales que se influyen en la formalización de los resultados obtenidos.
        El objeto de esta perspectiva es el cómo adecuar los SRI., las recuperaciones, las características de los usuarios finales y a los necesidades de un proceso interactivo.
        Esta perspectiva se interesa por actualizar las condiciones de cómo surgen las necesidades de información y como influye esas condiciones en el proceso de búsqueda.
        También investiga la influencia de las características individuales de los usuarios. Ejemplo: sexo edad, conocimiento de la materia, experiencia con ordenadores...cómo influyen en el proceso de búsqueda y la eficacia de búsqueda de resultados.
        También analiza cómo se desarrolla ese proceso, la interacción, cómo va cambiando el proceso de búsqueda, e incluso la propia información durante ese proceso.
        Aunque es frecuente que se denomina centrada en el usuario a cognitiva, hay una tendencia a reconocer que hay una perspectiva centrada en el usuario dentro de la cual hay una orientación cognitiva que se preocupa sobre todo por el desarrollo del proceso de búsqueda.
        En palabras de INGWERSEN la orientación cognitiva tiene el fin de entender como las categorías de los modelos conceptuales de los usuarios afectan al modelo de búsqueda y se modifican durante ese proceso. Respecto al concepto de relevancia, para esa perspectiva, esta es la primera relevancia conceptual o de situación: es la primera subjetiva que trata de valorar la utilidad de documentos recuperados para el usuario que plantea la búsqueda (un documento es útil dependiendo de varios factores. EJ idiomas, que se conozca el documento...
        BELKIN, ELLIS, BORGMAN Y BATES son otros autores sobre esto.
        Sistemas de recuperación de información.
        Es una expresión que tiene muchos equivalentes ( recuperación de información).
        ·         Recuperación automatizando información es un equivalente.
        ·         Almacenamiento y recuperación de información.
        ·         Sistema de almacenamiento y RI.
        ·         Sistemas de almacenamiento, conservación y RI: SACRI
        Recuperación de documentos: no es una equivalencia muy habitual pero si en las décadas de los 80. esto pasa también con:
        ·         Recuperación de texto:
        o    Texto libre
        o    Texto concepto: sigue siendo la principal orientación de los SRI. Aunque actualmente se comienza a trabajar mucho con imagen y sonido.
        Las definiciones delos SRI se establecen a partir de las diferencias entre RI y R de datos. Se hace esta diferencia en 4 aspectos, y que los emplea BLAIR sintetizando las 8 variantes que usa RISBERGEN:
        ·  Tipo de respuesta que recibe el usuario.
        ·  Relación entre la petición formal y la satisfacción del demandante de informa.
        ·  Criterio de éxito de la recuperación.
        ·  Velocidad de la recuperación con éxito.
        Los SRI se diferencian de los datos porque los primeros surgen por las debilidades de los sistemas de datos para gestionar la información textual.
        DIFERENCIAS
        ·         TIPO DE RESPUESTA QUE RECIBE EL USUARIO:
        o    Recuperación de datos:
        Recuperación directamente que responde a la pregunta del usuario y que deben responder a la pregunta directa.
        La pregunta típica es específica “ quiero saber X”.
        o    Recuperación de información:
        Responde con la recuperación o respuesta indirecta que dirige al usuario a un conjunto de documentos que probablemente contendrán la información que necesitan.
        La pregunta que se hace a estos sistemas, la primera es poco específica y de carácter general: “quiero saber” acerca de X”
        Recibe una respuesta probabilística.
        ·         RELACIÓN ENTRE LA PETICIÓN FORMAL Y LA SATISFACCIÓN DEL DEMANDANTE DE INFORMACIÓN.
        o    Recuperación de datos:
        La relación necesaria entre una petición bien construida y la respuesta correcta.
        o    Recuperación de información:
        La recuperación probabilística entre una petición bien construida y una respuesta que puede ser o no satisfactoria.
        ·         CRITERIO DEL ÉXITO DE LA RECUPERACIÓN.
        o    Recuperación de datos:
        El criterio de éxito es la corrección de la respuesta y sobre todo la q se puede hacer una evaluación objetiva.
        o    Recuperación de la información:
        El criterio del éxito es subjetivo porque definitivamente depende de la utilidad que la información recuperada tenga para el usuario.
        ·         VELOCIDAD DE RECUPERACIÓN CON ÉXITO.
        o    Recuperación de datos:
        La velocidad de recuperación con éxito depende fundamentalmente de la velocidad física de acceso del sistema que se está usando.
        o    Recuperación de información:
        La velocidad de recuperación con éxito depende del número de decisiones lógicas que se deban tomar al realizar la búsqueda (tiempo que se tarda en crear la búsqueda, su posible reformulación, análisis, resultados).
        21 octubre 2002-11-02
        Características de los sistemas de recuperación de información.
        Los sistemas de recuperación de información, también llamados sistemas de gestión documental, son uno de los modelos de los sistemas de información automatizada, concretamente, dentro de estos sistemas de información automatizada, son el modelo orientado a la gestión de información textual desestructurada.
        Fueron pensados con el objetivo de superar las limitaciones que presentaban los sistemas de gestión de bases de datos.
        Los imperativos del modelo de datos relacional especialmente la NO admisión de grupos repetidos o atributos multivaluados y las exigencias de un modelo muy normalizado obligan a la descomposición de un objeto en un conjunto de relaciones.
        El modelo relacional exige para cualquier modelo de información, que existan una serie de campos para representar esa información, así creamos una estructura compleja de relaciones entre las diferentes informaciones.
        La existencia de los campos o atributos repetitivos o multivaluados, significa que nosotros tendríamos que repetir una entrada de registro para cada uno de los valores que aparezca repetido.
        En una base de datos relacional descomponemos la información en diferentes tablas que se relacionan entre si (por lo cual descomponemos el objeto) en las que aparecen los valores que se repiten y el identificante.
        La información se divide en diferentes tablas que se reúnen mediante la interrogación que se hace mediante SQL.
        Los sistemas de recuperación de información son concebidos para representar documentos o conjuntos de informaciones que no tienen ningún tipo de estructura o que tienen algún tipo de estructura formal en la que el valor de cada elemento carácter puede ser variable, tanto en el número de ocurrencias, como en su longitud y ya no tanto en la información que contiene.
        También fueron concebidos para facilitar el acceso a documentos por múltiples vías o puntos de acceso, fundamentalmente para ceda una de las palabras que contiene.
        Podemos definir estros sistemas como sistemas automatizados cuyo objetivo es la recuperación de documentos que contengan información relevante para satisfacer las necesidades del usuario expresadas mediante una estrategia de búsqueda.
        Todo sistema de recuperación de información realiza dos tareas básicas:
        •Representación
        •Búsqueda
        Se debe entender por REPRESENTACÓN el proceso mediante el cual el sistema transforma un documento previamente almacenado a la ecuación, enunciado de búsqueda del usuario en entradas de índice, en puntos de acceso que pretenden representar por un lado la información que contiene el documento, y por otro la necesidad de información del usuario.
        La BÚSQUEDA en sistema de recuperación de información es el proceso mediante el cual el sistema examina las representaciones de los documentos y las compara o equipara con las representación de las consulta.
        La finalidad de este proceso es determinar qué representación de los documentos coinciden con la búsqueda o son más similares.
        Características de los sistemas de recuperación de información:
        •Cómo se almacena la información
        •
        •Estructura de los datos
        •Técnicas de comparación
        •Facilidades de interacción con el usuario
        La organización de la información documental en los sistemas de recuperación de información parten del principio de que la información que tiene que tratar el sistema de información se procesa a partir de documentos, entendidos estos documentos como frecuencias más o menos extremas de caracteres que se agrupan firmando palabras, que a su vez forman frases, párrafos o campos de información que en un números variable componen los documentos.
        A pesar de que en principio estos sistemas se crean para trabajar con información estructurada . Esto hay que entenderlo de forma relativa ye que los documentos de los SRI siempre tienen algún tipo de estructura formal interna.
        Inicialmente los SRI fueron diseñados para ser usados con información bibliográfica que sustituyen a loa documentos originales de forma que si usamos referencias bibliográficas tanto la representación como la búsqueda que hace el SRI se realiza sobre documentos secundarios.
        Con el paso del tiempo se abarató el coste de almacenamiento de la información electrónica y se empieza a considerar habitual el almacenamiento y por tanto la recuperación del texto completo de los documentos.
        Actualmente conviven las dos posibilidades y los SRI pueden trabajar tanto con representaciones como con documentos originales.
        Las representaciones de los documentos originales se denominan desde hace unos años METAINFORMACIONES y pueden ser registros bibliográficos formalizados mediante formato MARC, pueden ser también registros de una base de datos con información estructurada en campos y también pueden ser representaciones de los documentos que en un principio se consideró la información más desestructurada que son documentos en formato html.
        (La iniciación de formalización de etiquetas meta: METADATA ELEMENT SET es la de DUBLÍN CORE)
        Aunque se trabaje con el texto completo del documento tampoco podemos hablar de documentación completamente estructurada ya que ningún documento electrónico tiene una_____________________________???????
        Esta definición puede estar simplemente destinada a la presentación formal de los documentos, puede ser una estructuras en la que solo se estructura la información necesaria.
        También la estructura puede estar orientada a realizar una descripción formal del contenido de los documentos, en este caso, se indicará cuál es el autor del documento, título y la información que contenga se estructura normalmente de forma jerárquica.
        Este tipo de marcado es el que realizan lenguajes como: sgml, html, xml.
        ____________?????????????????????________________(falta algo??????)
        Esta estructura cuando trabajamos con representaciones de los documentos, habitualmente, permite identificar distintas partes del registro que almacena en conjunto la información.
        Hay varias soluciones para almacenar estas estructuras de registro variable:
        •Una posibilidad es que con el inicio de cada nuevo campo se almacena una etiqueta que lo identifica y además existen unas marcas que identifican tanto el final del campo como el final del registro:
        !Fin de campo #
        !Fin de registro "
        Para facilitar la recuperación de información y como los campos son de longitud variable, en algunos casos se incluyen también la información de longitud del campo.
        •Una alternativa a este modelo consiste en guardar toda la información sobre la estructura del registro en un área diferenciada de datos propiamente dichos que habitualmente se denomina DIRECTORIO.
        Esto es lo que se hace con los registros en formato Marc.
        Cuanto mayor información tengamos sobre el registro mayor precisión podemos tener a la hora de definir los índices del sistema y por lo tanto mayor precisión a la hora de la recuperación.
        La estructura de datos para el acceso a la información.
        Los sistemas de gestión de datos de Bases de datos documentales mantienen una estructura determinadas para facilitar el acceso a la documentación que contiene el fichero de texto de forma no secuencial.
        Habitualmente, suelen ofrecer difíciles métodos de indización y acceso ala información.
        Esta flexibilidad da muchas posibilidades a la hora de parametrizar los índices que van a facilitar el acceso sistema.
        Ej: Campo materia del formato Marc
        65008 $a Mujeres $x Situación Social $z Amdalucía
        Los índices que podemos generar:
        Índice de subcampo
        Índice de palabras clave
        Índice de materias que recoge la información de cada uno de los subcampos
        Índice de materias de palabras clave
        22 Octubre 2002
        En cualquier caso todos estos sistemas elaboran índices o estructuras de acceso a los documentos a partir de las palabras que contienen.
        Este proceso se denomina habitualmente INDIZACIÓN AUTOMÁTICA MEDIANTE PALABRAS CLAVE.
        Por medio de esta indización automática por palabras clave, se genera un fichero inverso, que es un índice que contendrá la relación alfabética de todos los términos contenidos en los campos indizables del fichero texto más la información posicional correspondiente.
        Cuando el usuario introduce un término de búsqueda, el sistema de recuperación accede al fichero inverso para localizar ese término y recoger la información posicional.
        Como el tamaño de los registros del fichero de texto es variable, esta información posicional del fichero inverso, si la información posicional del fichero inverso remite al fichero índice de texto que es donde tenemos la información de la localización del documento.
        1.La información sobre la posición del término.
        2.Los términos que podemos seleccionar
        1. La información sobre la posición del término que se especifica en el fichero inverso va a condicionar las posibilidades de recuperación Si solamente incluimos el número del documento, solamente podemos indicar al sistema que los términos de búsqueda están en un solo documento nada más.
        Si queremos que se puedan realizar búsquedas más precisas tenemos que incluir más información sobre la posición del término.
        2. Términos que se incluyen en el índice, en principio cualquier palabra que aparezca en un documento almacenado en el sistema puede servir para representar su contenido, es decir, puede servir como punto de acceso o entrada de un índice.
        En la práctica se realiza un proceso de selección para eliminar términos no significativos y reducir el ruido documental en la recuperación.
        Este proceso de selección puede ser más o menos exhaustivo y puede afectar simplemente a la eliminación de palabras vacías, pero también puede afectar a la normalización de formas flexionadas o derivadas.
        "Eliminación de palabras vacías
        "Normalización de los singulares y plurales
        "Normalización de femeninos y masculinos
        "Normalización de tiempos verbales
        "Normalización de prefijos y sufijos
        Cuando se realiza algún tipo de normalización se puede adoptar al menos dos soluciones para gestionar las búsquedas, es decir, comparar los términos de los usuarios con los normalizados.
        1.- Someter el enunciado de búsqueda al mismo proceso de normalización que a los términos del índice.
        2.- Mantener un fichero diccionario en el que se conserva la información sobre todos los términos (tanto los normalizados como los que no) que puede utilizar el usuario, y desde este fichero diccionario remitir al inverso en el que solo se almacena información sobre los documentos que contiene el término normalizado.
        1.2.3.técnicas de equiparación.
        Los índices de estructura de datos de un SRI, permiten realizar operaciones de búsqueda mediante técnicas que equiparan los enunciados que han usado los usuarios con los términos almacenados en los índices del sistema.
        - Estas técnicas permiten recuperar o realizar búsquedas de documentos que contengan uno o varios términos sin importar en qué campo o parte del texto.
        - Búsquedas de documentos que contengan uno o varios términos en un campo o subcampo concreto (en un párrafo o frase)
        - Búsquedas por uno o varios términos con truncamientos.
        El uso de uno u otros dependerá de la forma en la que tengamos estructurada la información.
        La clasificación tradicional de las técnicas de equiparación empleadas, se realiza en función del grado de coincidencia entre la búsqueda y los términos del índice que exigen esas técnicas para que se recuperen los documentos.
        En función de este criterio se distingue entre:
        ·  Técnicas de equiparación exacta
        ·  Técnicas de equiparación parcial
        a)Técnicas de equiparación exacta! los documentos solo se recuperan cuando cumplen todas las condiciones del enunciado de búsqueda.
        Ej: Ríos Y Riberas Y España ! Debe incluir todos los términos de búsqueda
        Ríos O Riberas O España
        Producen muchos silencios documentales si usamos el operador “Y” y mucho ruido documenta si usamos “O”.
        b)Técnicas de equiparación parcial Permiten recuperar documentos en función de su similitud con el planteamiento de búsqueda y no de la coincidencia total de los descriptores con los términos que aparecen en el documento.
        Eliminan la necesidad de usar operadores boléanos.
        Para facilitar la selección de información los documentos recuperados se ordenan en función de su relevancia respecto de la búsqueda, relevancia que está determinada por el grado de coincidencia con el enunciado de búsqueda.
        Mejoras en la interacción con el usuario.
        Al mismo tiempo que se mejoraban las técnicas de equiparación, la investigación sobre la experiencia de usuarios reales demostraba que para esto incluso era cuestionable el sistema de búsqueda por equiparación, porque con frecuencia el problema es que no tienen los recursos necesarios para convertir su carencia o necesidad de información en una pregunta formal a un SRI.
        Para mejorar la interacción en cualquier tipo de búsqueda los SRI han ido incorporando diferentes herramientas que mejoran tanto la equiparación, como las búsquedas exploratorias.
        Los estudios empíricos han demostrado que entre un 7%-10% de las búsquedas fallan porque incluyen este tipo de errores, de manera que las técnicas que se han desarrollado para conseguirlos permiten mejorar la equiparación, coincidencia con los índices.
        El resto de mejoras van orientadas a facilitar las búsquedas exploratorias (BROWSING).
        - Visualización de índices alfabéticos y sistemáticos que deberían permitir al usuario hacerse una idea de la información que puede encontrar en el sistema, además de llevar al usuario desde el término que ha utilizado hasta el admitido como punto de acceso y también encontrar términos de búsqueda en los que previamente no había pensado.
        - Visualización de registros en diferentas formatos el objetivo es que el usuario tenga información suficiente sobre el documento para facilitar los juicios de relevancia (si el documento le interesa o no) y también para facilitar la potencial selección de nuevos términos de búsqueda.
        - Otra herramienta incorporada son los enlaces hipertextuales entre registros-enlaces que permiten visualizar registros que comparten la información de los campos que son puntos de acceso normalmente.
        - Modificación de las búsquedas mediante técnicas de retroalimentación por relevancia (relevance feedback) técnicas que permiten recuperar automáticamente documentos similares al que un usuario ha considerado relevante.
        Presentación de información a los usuarios mediante interfaces gráficas y metáforas de la biblioteca Representaciones de la biblioteca o información que contiene el sistema que trata de aclarar la forma en la que está organizada la información.

        http://html.rincondelvago.com/busqueda-y-recuperacion-de-la-informacion.html

        Recuperación de información

        Contenidos

        1. Evolución del significado del término
        2. Recuperación de Información y Recuperación de Conocimiento
        3. Recuperación de Información y Sistemas de Recuperación de Información
        4. Metadatos, descriptores e indización
        5. Recuperación de Información mediante vocabularios controlados
        6. Relevancia
        7. Medidas de Recuperación
        8. Modelos de Recuperación


        La recuperación de información es el conjunto de actividades orientadas a facilitar la localización de determinados datos u objetos, y las interrelaciones que estos tienen a su vez con otros. Existen varias disciplinas vinculadas a esta actividad como la lingüística, la documentación o la informática.

        1. Evolución del significado del término
        Aunque tradicionalmente se limitaba a la recuperación de documentos escritos, el término se redefinió para incorporar la creciente aparición de materiales multimedia. Asi, los nuevos buscadores de información en Internet, que originariamente buscaban textos, expandieron su actividad a imágenes, videos o audios.  De esta forma términos como Recuperación de textos, recuperación documental y recuperación de información son utilizados como equivalentes.
        Por otro lado, la necesidad de localizar datos concretos ha ido expandiendo su área de actuación. En la actualidad se está migrando desde la recuperación de documentos a la recuperación pregunta-respuesta, que responden con el dato concreto y no con el conjunto de documentos que posiblemente contenga este dato.


        2. Recuperación de Información y Recuperación de Conocimiento
        Con frecuencia, la información responde a qué es algo y que propiedades lo describe, pero tan sólo parte de la información indica cómo se elabora o se desarrolla un proceso. Este tipo de información es básicamente  conocimiento. Esta premisa muestra que el conocimiento implica dos cuestiones fundamentales: la existencia de un fin y una relación con otra información de un sistema para lograr un objetivo.
        La existencia de un fin para saber cómo se realiza algo presupone la intencionalidad y necesidad de lograr algo. Esta finalidad ha provocado que el conocimiento se asocie a los seres vivos.
        Por otra parte, el conocimiento implica que la información esté relacionada dentro de un sistema para lograr un objetivo. La información necesaria sobre cómo procesar un objetivo se transforma así en una serie de reglas y restricciones. De esta manera es comprensible que muchos sistemas de recuperación especializada, hayan pasado a autodenominarse Sistemas de Recuperación de Conocimiento.
        Asi el desarrollo de ontologías, agentes inteligentes y de la inteligencia artificial ha propiciado un cambio de denominación hacia recuperación del conocimiento. Desde esta perspectiva no se pretende que el buscador recupere por palabras presentes en los documentos, sino que sea posible recuperar procesos y otros tipos de interrelaciones entre los elementos almacenados.

        3. Recuperación de Información y Sistemas de Recuperación de Información
        En la literatura, la exposición de estas estrategias suele estar vinculada a determinado Sistema de Recuperación. Ya que el desarrollo de estas aplicaciones informáticas surgió como respuesta a la gestión de la sobreabundancia de información actual. La forma en que esta información es almacenada suele ser mediante Bases de Datos y repositorios documentales.

        4. Metadatos, descriptores e indización
        Dado la limitada capacidad de los ordenadores, originariamente, la recuperación tenía que estar limitada a unos pocos atributos o metadatos del objeto. Entre los que destacaban el autor, el título o las palabras más significativas del contenido expresado en el texto o descriptores. La asignación de estos descriptores, denominada indización, era manual.
        Estos mismos metadatos son empleados actualmente en la Web Semántica por su mayor simplicidad que el lenguaje natural, facilitando la interoperabilidad y la navegación en la Web.
        La indización automática trata de automatizar la asignación de términos relevantes a un documento de forma automática. La relevancia es calculada mediante cálculos estadísticos y localización del mismo. Ejemplos son tf-IDF, la eliminación de palabras vacías, el mayor valor de los términos en los títulos, en formato destacado (p.e. negrilla), etc. Muchos de estos factores son utilizados para ordenar los resultados en los motores de recuperación.

        5. Recuperación de Información mediante vocabularios controlados
        Los descriptores, usualmente, estaban listados en un vocabulario de un dominio cerrado y normalizado, denominado controlado. En este vocabulario pueden existir, incluso, interrelaciones entre estos términos. El control de este vocabulario trata de solventar dos de los principales problemas de la recuperación de información: la polisemia, la homonimia y la sinonimia.
        Las relaciones de estos vocabularios pueden ser de varios tipos. En el caso de los tesauros están son de equivalencia, jerarquía y relación. Los tesauros facetados  disponen de varias vistas que facilitan la recuperación.

        6. Relevancia
        La relevancia es una medida del grado en que determinado elemento responde a una consulta. Su medida es frecuentemente subjetiva, ya que responden a la consulta en función del conocimiento de quién evalúa y del que pregunta.
        7. Medidas de Recuperación
        El funcionamiento de un sistema de recuperación de información se puede medir analizando los datos (o documentos) recuperados ante una consulta. Dos son las principales medidas:
        • Precision: volumen de datos relevantes entre el total de datos recuperados 
        • Exhaustividad: volumen de datos relevantes entre el total de datos  relevantes en el repositorio o la BD
        Ambas medidas tienden a evolucionar en sentido inverso (Ley de Cleverdon). Cuanto más crece la precisión más disminuye la exhaustividad, y al contrario. Esto es debido a que miden factores distintos, el ruido y el silencio:
        • Ruido: información recuperada no relevante
        • Silencio: información no recuperada que es relevante
        Dado que para calcular estas medidas es necesario conocer cuantos elementos relevantes existen, son necesarios listados de la relevancia de los documentos ante un conjunto de consultas. Estos listados se llaman colecciones de pruebas (test collections), y son utilizadas en competiciones internacionales para testear los sistemas de recuperación. La más conocida de las cuales es TREC.

        8. Modelos de Recuperación
        Los modelos de recuperación tratan de calcular el grado en que determinado elemento de información responde a determinada consulta. En general esto se consigue calculando los coeficientes de similitud (Coseno, Phi, etc). Los tres modelos más utilizados son:
        • Booleano: se crea un conjunto con los elementos de la consulta y otro con los documentos, y se mide la correspondencia.
        • Vectorial: en el que la consulta y los términos del documento se representan mediante dos vectores, y se mide el grado en que ambos vectores divergen. 
        • Probabilístico: se calcula la probabilidad en que el documento responde a la consulta. Frecuentemente utiliza retroalimentación. La retroalimentación se basa en que el usuario indique que documentos se parecen más a su respuesta idonea, para asi reformular la consulta.
        http://sites.google.com/site/glosariobitrum/Home/recuperacion-de-informacion

        miércoles, 1 de septiembre de 2010

        Sistemas de Recuperación de Información

        1. Recuperación De Información 
        2. Sistemas De Recuperación De Información 
        3. Búsqueda Y Recuperación De Información 
        4. Lenguajes De Recuperación De Información 
        5. Metadatos 
        6. Posicionamiento Web 
        by: Claudia M. Torres 
        Licencia de Creative Commons
        Manual de Alfresco by Claudia Marcela Torres is licensed under a Creative Commons Attribution-ShareAlike 2.5 Colombia License.
        Based on a work at www.alfresco.com.
        Permissions beyond the scope of this license may be available at http://creativecommons.org.