Recuperación de Información | Sistemas de Información y Documentación | Universidad de la Salle
U. de la SalleEres el visitante No.
Mostrando entradas con la etiqueta Recuperación De Información. Mostrar todas las entradas
Mostrando entradas con la etiqueta Recuperación De Información. Mostrar todas las entradas
martes, 12 de octubre de 2010
Ecuación de búsqueda
Es el término o el conjunto de términos relevantes para la localización de fuentes de acuerdo a una búsqueda de información especifica, se obtienen a traves la del objetivo inicial de búsqueda al sistema de entrada de los propios instrumentos de búsqueda.
Instrumento de Búsqueda
Es la herramienta diseñada para estructurar el proceso de búsqueda de información, consta de un sistema de entrada, una base de datos sobre la que realizar la búsqueda y un sistema de actualización de su contenido. El tipo de información en la base de datos junto y el sistema de actualización, permiten conocer la veracidad del instrumento y por lo tanto el número de referencias relevantes arrojadas ante una búsqueda determinada.
Estrategia de Búsqueda
Procedimiento que permite estructurar la secuencia de pasos a seguir al utilizar un determinado método de búsqueda de información. Una estrategia bien estructurada permite asegurar la verificabilidad de la búsqueda, así como acordar razonablemente que las variaciones en los resultados de la búsqueda se deben a una variación en el universo de búsqueda y no en el propio procedimiento.
Método de Búsqueda.
Perspectiva previa al planteamiento de una búsqueda de información concreta que determina, a través de la elección de un método de búsqueda concreto, la forma en la que ésta será llevada a cabo, así como el tipo de resultados que se espera obtener.
OBJETIVOS DE LA RECUPERACIÔN DE INFORMACIÔN
- Recuperar sobre cualquier tipo de documento
- Entender las preguntas
- Buscar el mecanismo para poder comparar y mostrar la mejor forma posible los resultados con precisión
jueves, 16 de septiembre de 2010
El concepto de recuperación de información
Los fundamentos sobre los que construir una técnica exitosa de recuperación de información en Internet son:
Según la creación del recurso:
La creación de listados, índices y catálogos ordenados por áreas o materias, de forma que el usuario dispusiese de un conjunto de fuentes seleccionadas en las que empezar a buscar. El ejemplo más conocido es el norteamericano Yahoo!. Han ido añadiendo motores internos a sus prestaciones, de forma que permiten consultar mediante ecuaciones sus
bases de datos. La creación automática de bases de datos basadas en índices o ficheros
inversos, mediante unas aplicaciones que rastrean o exploran todo el ámbito Web, llamados robots, spiders o wanderers. Estos robots rastrean el web a la búsqueda de documentos, obtienen una copia, la indizan, y usan los enlaces presentes en los mismos para localizar nuevos documentos
Según la herramienta utilizada:
Finalmente y dependiendo de las prestaciones del agente, las respuestas pueden ser filtradas, aplicando criterios propios de eliminación de duplicados, reordenación de resultados, etc.
4. Por robot personal2: Se trata de aplicaciones que se instalan en el
computador del usuario, y que son capaces de acceder a un servidor web,
construir un mapa de índices de sus contenidos, y utilizar los mismos para
acceder a la información que sea interesante para el usuario, obteniendo
copias de las páginas o documentos web contenidos en el mismo.
- El conocimiento de las características propias de los documentos existentes en Internet, y
- La teoría de la recuperación de información
Según la creación del recurso:
La creación de listados, índices y catálogos ordenados por áreas o materias, de forma que el usuario dispusiese de un conjunto de fuentes seleccionadas en las que empezar a buscar. El ejemplo más conocido es el norteamericano Yahoo!. Han ido añadiendo motores internos a sus prestaciones, de forma que permiten consultar mediante ecuaciones sus
bases de datos. La creación automática de bases de datos basadas en índices o ficheros
inversos, mediante unas aplicaciones que rastrean o exploran todo el ámbito Web, llamados robots, spiders o wanderers. Estos robots rastrean el web a la búsqueda de documentos, obtienen una copia, la indizan, y usan los enlaces presentes en los mismos para localizar nuevos documentos
Según la herramienta utilizada:
- Directa: El navegador se conecta al servidor Web que actúa como interfaz del motor de búsqueda correspondiente a la base de datos que desea consultar. El servidor le envía una página Web que actúa como interfaz de interrogación, a través de la cual formula la consulta. El servidor la recibe, procesa y envía como respuesta una nueva página Web, generada de forma dinámica, que contiene las respuestas más pertinentes a la cuestión formulada por el usuario.
- Por intermediario: El navegador se conecta a un servidor web que le ofrece una interfaz de interrogación propia. Esta interfaz le permite interrogar una base de datos correspondiente a un motor de búsqueda situado en un servidor web diferente al que ofrece la interfaz. La interfaz actúa como intermediario entre el motor de búsqueda de destino y el usuario. El interés de estos intermediarios (metabuscadores) se da cuando consultan a múltiples motores de búsqueda.
- Por agente: El usuario instala en su computador una aplicación que permite formular las ecuaciones de búsqueda y remitirlas a uno o varios motores de búsqueda.
Finalmente y dependiendo de las prestaciones del agente, las respuestas pueden ser filtradas, aplicando criterios propios de eliminación de duplicados, reordenación de resultados, etc.
4. Por robot personal2: Se trata de aplicaciones que se instalan en el
computador del usuario, y que son capaces de acceder a un servidor web,
construir un mapa de índices de sus contenidos, y utilizar los mismos para
acceder a la información que sea interesante para el usuario, obteniendo
copias de las páginas o documentos web contenidos en el mismo.
Etiquetas:
recupe,
Recuperación De Información,
Sistemas de información y documentación,
sistemas de recuperación de información,
SRI,
Universidad de la Salle
Consultas al STRID: las ecuaciones de búsqueda
La búsqueda se realiza sobre un conjunto de términos introducido en el sistema por el usuario. Sin embargo, esta es la fase final de un proceso que comienza por el análisis de los documentos que se van a introducir, los datos que los conforman, y cómo estos forman una estructura de datos, como se ha visto en el capítulo correspondiente. Existen múltiples metodologías de diseño de estructuras de datos, cada una con sus virtudes y sus defectos. La estructura de datos se plasma en el sistema informático en una estructura de base de datos, a partir de la cual se introducen los documentos. La organización de la información con vistas a su recuperación dentro de un sistema documental ha producido abundante bibliografía en la que pueden analizarse múltiples aspectos (TAGUE SUTCLIFFE, 1996).
4.6.1. El proceso de búsqueda.
El proceso de búsqueda de la información es más complejo de lo que pueda parecer en un primer momento, y tiene, con posibles variaciones (véase el panorama esbozado con anterioridad sobre la recuperación de información), las siguientes fases:
1.- Definición del tema de búsqueda.
2.- Selección de términos descriptivos sobre el tema de búsqueda. Consulta de tesauros o diccionarios, etc.
3.- Selección de las bases de datos sobre las que realizar la búsqueda.
4.- Formulación y ejecución de ecuaciones de búsqueda.
5.- Evaluación de los resultados. Replanteamiento, si procede, de las ecuaciones para ajustar la búsqueda.
Se debe considerar, además, que la definición del tema y de los términos para la búsqueda se hace en lenguaje natural, lenguaje que debe traducirse a la terminología empleada en la base de datos, y que los términos empleados en las ecuaciones son la traslación al lenguaje de interrogación de la base de datos de los términos originales, combinados mediante operadores que aplican lógica matemática. Tampoco hay que olvidar que la localización de esos términos dentro de la base de datos está en muchos casos sujeta a la estructura de campos existente. Lo anterior hace ineludible la utilización de lenguajes documentales para la correcta explotación de las bases de datos documentales.
En principio, debe aceptarse que la búsqueda incluye una serie de términos significativos, los cuales describen el área de interés para la recuperación de información. Estos términos mantienen entre ellos algún tipo de relación semántica. Esta relación debe reflejarse a través de la utilización de operadores que la reflejen, y por esta causa una ecuación de búsqueda se compone de dos tipos de elementos. En primer lugar, los términos que representan el tema de interés, y en segundo lugar, un conjunto de operadores que expresan la relación que deben mantener los términos entre sí. Este segundo tipo de elementos son el objeto de los siguientes párrafos.
4.6.2. Tipos de operadores utilizados en las ecuaciones de búsqueda.
La combinación de los términos necesarios para la recuperación de los documentos adecuados se basa en la utilización de unos operadores, especialmente los denominados booleanos, en honor de George Boole, que en 1847 publicó un trabajo titulado The mathematical Analysis of Logic, en el que sentó las bases de la denominada álgebra lógica o simbólica. La combinación de los términos mediante los operadores crea una forma matemática, una ecuación, susceptible de ser tratada por medios informáticos.
Los operadores booleanos establecen relaciones entre los términos, y son O (operador de unión), Y (operador de intersección) y NO (operador de exclusión). Trabajan sobre el conjunto de los documentos, estableciendo subconjuntos con aquellos documentos que se ajusten a las condiciones fijadas en la ecuación.
La complejidad que rodea a los mecanismos de recuperación de la información ha hecho necesario aplicar otros operadores, que complementen a los booleanos. En primer lugar, los operadores de localización, referidos a la posición de los términos dentro de los documentos. Se basan en una hipótesis según la cual la cercanía entre dos términos puede significar una estrecha relación entre ellos. Pueden ser absolutos, cuando se establece que un término debe aparecer en un campo determinado, independientemente del resto de los términos incluidos en la ecuación, o relativos, cuando se establece que un término debe tener una posición referida a otro término incluido en la ecuación, por ejemplo en la misma línea, la misma frase, separados por "x" palabras, etc. Ambos pueden combinarse. También se encuentran los operadores de rango o intervalo, que establecen un intervalo, dentro del cual deben encontrarse los términos a recuperar, especialmente utilizados en la recuperación de datos numéricos y de fechas. Las dificultades que se desprenden de las características intrínsecas de los términos también afectan a la recuperación de la información. Se pueden plantear problemas con el uso de plurales de los términos, géneros o prefijos y raíces. Para intentar reducirlos, se emplean símbolos de truncamiento, cuya finalidad es indicarle al sistema de recuperación que se está buscando una cadena de caracteres dentro de un término, no un término en sí mismo.
Todos los operadores señalados pueden combinarse entre sí para crear ecuaciones complejas, considerando que siempre se establecen unas limitaciones por parte de los operadores. Normalmente, se ejecutan primero aquellas operaciones con los operadores más restrictivos, y su resultado se combina con los términos relacionados con operadores menos restrictivos. Los sistemas de gestión de bases de datos documentales incluyen en su documentación tanto los operadores disponibles y su uso, como las limitaciones y restricciones establecidas.
4.6.3. La recuperación mediante exploración.
La utilización de ecuaciones de búsqueda como principal herramienta en la recuperación de información plantea problemas, que los enfoques actuales de investigación pretenden resolver mediante la creación de mejores interfaces de usuario (INGWERSEN, 1992), que reflejen los mapas cognitivos de los usuarios, y permitan generar imágenes de los mismos que puedan ser utilizadas para interrogar los recursos de información. Interrogación que debería verse complementada por la capacidad de los sistemas de añadir funciones de exploración de los contenidos informativos, durante el proceso de recuperación. El fundamento de los procesos de exploración es la revisión y análisis de documentos por sus contenido, de forma que el sistema sea capaz de llevar al usuario a otras informaciones similares o relacionadas, sin necesidad de formular nuevas ecuaciones de búsqueda.
4.6.4. Los resultados: análisis y modificación.
Una vez considerado todo lo expuesto, y realizada una búsqueda, es de rigor analizar su pertinencia. Una alta pertinencia se caracteriza por la recuperación de los documentos adecuados a la información que se deseaba obtener, evitando la introducción de otros que puedan distorsionar el conjunto, y cumplir los requisitos de una correcta recuperación de la información En sistemas de tratamiento y recuperación de información documental, ésta debe ser exacta, exhaustiva, precisa, oportuna, íntegra y significativa. Por contra, el silencio (falta de documentos) y el ruido (exceso de documentos, muchos de ellos no significativos) caracterizan a un bajo nivel de pertinencia.
Como resultado del análisis anterior, cabe plantearse la adecuación de la respuesta obtenida a lo esperado. Pueden darse dos situaciones, ante las cuales deben adoptarse diferentes acciones. En un primer caso, puede suceder que el resultado de la ecuación sea demasiado escaso. Entonces procede ampliarla, lo cual puede hacerse con la utilización de términos más genéricos, sinónimos, o ampliación de truncamientos. En un segundo caso, si el resultado obtenido es excesivamente amplio, deben utilizarse medidas contrarias: utilización de términos más específicos, reducción de truncamientos, etc.
http://tramullas.com/documatica/4-6.html
Etiquetas:
bases de datos,
búsqueda de información,
Búsqueda y Recuperación de Información,
ecuaciones de búsqueda,
Recuperación De Información,
Sistemas de información y documentación
Percepción del desempeño en la búsqueda de información en bases de datos bibliográficas de los estudiantes de estomatología
El manejo de la información es un tema relevante si se considera la gran cantidad de publicaciones científicas acumuladas, que se desarrolla de manera exponencial. Internet se convirtió en el medio más dinámico y estimulante para encontrar y recuperar información biomédica desde la aparición de las bases de datos automatizadas.1 Pocos usuarios conciben hoy día que una revista científica no pueda consultarse en mayor o menor medida por este medio.2
En el área de la salud, una de las principales bases de datos bibliográficas es PubMed-Medline. En Latinoamérica se dispone de Lilacs, lo mismo que otras fuentes como la Cochrane Library, el Índice Médico Español (IME), Ebsco, ScienceDirect, SpringerLink y Scielo, entre otras.2 Existen también motores de búsqueda generales como Yahoo, Altavista, Google y otros muy populares. Estos últimos, a pesar de su utilidad científica, a menudo arrojan como resultados una serie de documentos que no alcanzan los niveles deseados de la búsqueda, con una marcada deficiencia relacionadas con la calidad de los productos, en relación con las palabras clave utilizadas, lo que facilita en oportunidades la distorsión académica en estudiantes.3,4
La forma básica para la búsqueda es mediante palabras clave,5,6 y términos controlados como los que ofrecen el MeSH y el DeCS, determinantes en la ejecución de una búsqueda eficiente.7-11 Igualmente, es posible especificar una búsqueda mediante el empleo de operadores lógicos (conjunciones y signos diacríticos), los operadores boleanos "and", "with", "or" y "not", y el truncado, o los llamados límites, que ayudan a restringir los resultados según fechas, idiomas, fuentes, autores y tipo de material, entre otros.
El usuario debe dominar las bases de datos, lo que significa, entre otros aspectos, la correcta identificación y el empleo de los términos controlados, el uso de los operadores y los límites, de las diferentes facilidades y filtros para la búsqueda, el refinamiento de la búsqueda de acuerdo con el volumen de los resultados, su organización, etcétera. Pero los usuarios no realizan frecuentemente estas acciones de la manera más apropiada. En otras ocasiones, desconocen las facilidades que ofrecen los sistemas y presentan una pobre cultura de la información y, por tanto, carecen de las competencias necesarias para desempeñarse correctamente en la búsqueda y el manejo de la información.12
Una búsqueda pertinente de datos conduce a información consistente y útil.13 Dominar las herramientas necesarias para hacerlo es una meta cuyo cumplimiento es cada vez más deseable entre los profesionales de la salud,4 quienes al emplear el total de las facilidades que ofrecen medios como las bases de datos pueden actualizar sus conocimientos en general y disponer de la información necesaria para el manejo de sus casos clínicos concretos, establecer un mejor diagnóstico y tratamiento y realizar nuevas propuestas científicas.14,15 ya sea que actúen como terapeutas en clínica o dediquen su tiempo a procesos investigativos.
Espinoza, Rincón y Chacín, en los resultados de su estudio, realizado con profesores usuarios de Internet, encontraron que a pesar de la gran utilidad que representan los bancos de datos y los catálogos bibliográficos su uso es casi insignificante entre ellos, algo que pudiera ser ocasionado por la carencia de una política adecuada de entrenamiento en función de las necesidades específicas de los usuarios y sus instituciones.16
De igual manera, González y Santana estudiaron el comportamiento de los alumnos de medicina en la búsqueda de información en Internet. Entre sus observaciones sobresalen que solo el 15 % de ellos utiliza la base de datos PubMed-Medline en su labor de búsqueda, la cual constituye una de las de mayor prestigio internacional en el área de las ciencias médicas, además de que es la única en su sector con acceso gratuito. El análisis muestra también que los estudiantes dejan a un lado el Mesh Browser y tienen preferencia por el buscador Google, lo que los autores consideran preocupante en este nivel educativo.17
Nos propusimos realizar una valoración integral de los estudiantes seleccionados, en relación con la forma en que manejan las bases de datos para la solución de determinados problemas de información. No existen actualmente datos que describan la situación de los estudiantes en relación con este tema. Desde el punto de vista formativo en escenarios académicos es importante este tipo de investigaciones y de trabajos que facilitan los juicios valorativos y permiten a los docentes identificar las principales necesidades en este aspecto, a partir de una línea de base, que facilite la labor pedagógica, para potencializar los saberes y competencias en el manejo de las bases de datos por parte de los estudiantes de odontología.
La importancia que aporta al tema de investigación se ve reflejada en la calidad y cantidad de las publicaciones científicas referentes a la temática expuesta, pues se reporta que en la búsqueda bibliográfica a través de bases de datos se detectan diversidad de documentos de alta preponderancia y utilidad que permiten a los estudiantes mantenerse actualizados desde lo investigado y estar al tanto de la redefinición de teorías que permiten reconstruir el conocimiento científico en los diferentes campos de las ciencias. http://scielo.sld.cu/scielo.php?pid=S1024-94352010000100009&script=sci_arttext
Etiquetas:
búsqueda de información,
Recuperación De Información,
Sistemas de información y documentación,
sistemas de recuperación de información,
términos controlados,
Universidad de la Salle
Listas de términos controlados
La aparición de los primeros tesauros aplicados a la recuperación de información a principios de los años sesenta desplazaron, en gran medida, la utilización de los sistemas de clasificación tradicionales para la indización y la recuperación. Sin embargo, la creciente disponibilidad en los años setenta de bases de datos online puso el énfasis en los sistemas basados en el lenguaje natural, como alternativa a los lenguajes controlados.
Un tesauro proporciona un lenguaje o un conjunto de términos normalizados que describen un área temática. Aplicado a la indización de una base de datos, indica al buscador qué términos utilizar para recuperar el máximo número de documentos relevantes.Los términos del tesauro son utilizados por los indizadores para describir el contenido de las publicaciones con coherencia, amplitud y concisión.En la actualidad parece claro que la naturaleza complementaria del
lenguaje natural y del controlado, especialmente los tesauros, justificarían la necesidad de disponer de ambos procedimientos para recuperar información. Como señala Lancaster (1995), el modo normal de funcionamiento de un sistema de recuperación de información debe ser el de “búsqueda en dos niveles”, utilizando conjuntamente el lenguaje natural y términos controlado. Ampliar aca -> Documento PDF.
http://www.francog.com.ar/wp_archivos/2003/11/tesauros_y_listas_de_terminos_controlados.php
Etiquetas:
bases de datos,
lenguaje documental,
Recuperación De Información,
Sistemas de información y documentación,
SRI,
términos controlados
miércoles, 15 de septiembre de 2010
Conceptos básicos de RI
Etiquetas:
Búsqueda y Recuperación de Información,
Recuperación De Información,
Sistemas de información y documentación,
SRI,
Universidad de la Salle
Introduccion SRI
Etiquetas:
Recuperación De Información,
Sistemas de información y documentación,
sistemas de recuperación de información,
SRI,
Universidad de la Salle
Recuperación de Información y el modelo de Espacio Vectorial
Etiquetas:
Recuperación De Información,
recuperación de la información,
Sistemas de información y documentación,
SRI,
Universidad de la Salle
Recuperación de información
Contenidos
1. Evolución del significado del término
2. Recuperación de Información y Recuperación de Conocimiento
3. Recuperación de Información y Sistemas de Recuperación de Información
4. Metadatos, descriptores e indización
5. Recuperación de Información mediante vocabularios controlados
6. Relevancia
7. Medidas de Recuperación
8. Modelos de Recuperación
La recuperación de información es el conjunto de actividades orientadas a facilitar la localización de determinados datos u objetos, y las interrelaciones que estos tienen a su vez con otros. Existen varias disciplinas vinculadas a esta actividad como la lingüística, la documentación o la informática.
1. Evolución del significado del término
Aunque tradicionalmente se limitaba a la recuperación de documentos escritos, el término se redefinió para incorporar la creciente aparición de materiales multimedia. Asi, los nuevos buscadores de información en Internet, que originariamente buscaban textos, expandieron su actividad a imágenes, videos o audios. De esta forma términos como Recuperación de textos, recuperación documental y recuperación de información son utilizados como equivalentes.
Por otro lado, la necesidad de localizar datos concretos ha ido expandiendo su área de actuación. En la actualidad se está migrando desde la recuperación de documentos a la recuperación pregunta-respuesta, que responden con el dato concreto y no con el conjunto de documentos que posiblemente contenga este dato.
2. Recuperación de Información y Recuperación de Conocimiento
Con frecuencia, la información responde a qué es algo y que propiedades lo describe, pero tan sólo parte de la información indica cómo se elabora o se desarrolla un proceso. Este tipo de información es básicamente conocimiento. Esta premisa muestra que el conocimiento implica dos cuestiones fundamentales: la existencia de un fin y una relación con otra información de un sistema para lograr un objetivo.
La existencia de un fin para saber cómo se realiza algo presupone la intencionalidad y necesidad de lograr algo. Esta finalidad ha provocado que el conocimiento se asocie a los seres vivos.
Por otra parte, el conocimiento implica que la información esté relacionada dentro de un sistema para lograr un objetivo. La información necesaria sobre cómo procesar un objetivo se transforma así en una serie de reglas y restricciones. De esta manera es comprensible que muchos sistemas de recuperación especializada, hayan pasado a autodenominarse Sistemas de Recuperación de Conocimiento.
Asi el desarrollo de ontologías, agentes inteligentes y de la inteligencia artificial ha propiciado un cambio de denominación hacia recuperación del conocimiento. Desde esta perspectiva no se pretende que el buscador recupere por palabras presentes en los documentos, sino que sea posible recuperar procesos y otros tipos de interrelaciones entre los elementos almacenados.
3. Recuperación de Información y Sistemas de Recuperación de Información
En la literatura, la exposición de estas estrategias suele estar vinculada a determinado Sistema de Recuperación. Ya que el desarrollo de estas aplicaciones informáticas surgió como respuesta a la gestión de la sobreabundancia de información actual. La forma en que esta información es almacenada suele ser mediante Bases de Datos y repositorios documentales.
4. Metadatos, descriptores e indización
Dado la limitada capacidad de los ordenadores, originariamente, la recuperación tenía que estar limitada a unos pocos atributos o metadatos del objeto. Entre los que destacaban el autor, el título o las palabras más significativas del contenido expresado en el texto o descriptores. La asignación de estos descriptores, denominada indización, era manual.
Estos mismos metadatos son empleados actualmente en la Web Semántica por su mayor simplicidad que el lenguaje natural, facilitando la interoperabilidad y la navegación en la Web.
La indización automática trata de automatizar la asignación de términos relevantes a un documento de forma automática. La relevancia es calculada mediante cálculos estadísticos y localización del mismo. Ejemplos son tf-IDF, la eliminación de palabras vacías, el mayor valor de los términos en los títulos, en formato destacado (p.e. negrilla), etc. Muchos de estos factores son utilizados para ordenar los resultados en los motores de recuperación.
5. Recuperación de Información mediante vocabularios controlados
Los descriptores, usualmente, estaban listados en un vocabulario de un dominio cerrado y normalizado, denominado controlado. En este vocabulario pueden existir, incluso, interrelaciones entre estos términos. El control de este vocabulario trata de solventar dos de los principales problemas de la recuperación de información: la polisemia, la homonimia y la sinonimia.
Las relaciones de estos vocabularios pueden ser de varios tipos. En el caso de los tesauros están son de equivalencia, jerarquía y relación. Los tesauros facetados disponen de varias vistas que facilitan la recuperación.
6. Relevancia
La relevancia es una medida del grado en que determinado elemento responde a una consulta. Su medida es frecuentemente subjetiva, ya que responden a la consulta en función del conocimiento de quién evalúa y del que pregunta.
7. Medidas de Recuperación
El funcionamiento de un sistema de recuperación de información se puede medir analizando los datos (o documentos) recuperados ante una consulta. Dos son las principales medidas:
- Precision: volumen de datos relevantes entre el total de datos recuperados
- Exhaustividad: volumen de datos relevantes entre el total de datos relevantes en el repositorio o la BD
- Ruido: información recuperada no relevante
- Silencio: información no recuperada que es relevante
8. Modelos de Recuperación
Los modelos de recuperación tratan de calcular el grado en que determinado elemento de información responde a determinada consulta. En general esto se consigue calculando los coeficientes de similitud (Coseno, Phi, etc). Los tres modelos más utilizados son:
- Booleano: se crea un conjunto con los elementos de la consulta y otro con los documentos, y se mide la correspondencia.
- Vectorial: en el que la consulta y los términos del documento se representan mediante dos vectores, y se mide el grado en que ambos vectores divergen.
- Probabilístico: se calcula la probabilidad en que el documento responde a la consulta. Frecuentemente utiliza retroalimentación. La retroalimentación se basa en que el usuario indique que documentos se parecen más a su respuesta idonea, para asi reformular la consulta.
http://sites.google.com/site/glosariobitrum/Home/recuperacion-de-informacion
Etiquetas:
indización,
medidas de recuperación,
Metadatos,
modelos de recuperación,
Recuperación De Información,
relevancia,
sistemas de recuperación de información
Principales medidas de evaluación en r.i.
Una vez definido el concepto de relevancia y relacionando éste con si un documento es recuperado o no, podemos establecer una serie de medidas que nos servirán para evaluar los sistemas de recuperación. A continuación expondremos las principales medidas comunes a todos lo modelos de recuperación.
Los documentos pueden ser recuperados o rechazados al establecer la comparación entre la pregunta y la base de datos. El conjunto de documentos recuperados se divide, salvo en los sistemas perfectos, en dos grupos: documentos relevantes recuperados, es decir aquellos que se han recuperados correctamente y los no relevantes, recuperados erróneamente que provocan ruido en la salida. Los documentos no recuperados, que a su vez se dividen en los relevantes, rechazados por el sistema de manera errónea y los no relevantes, rechazados de manera correcta por el sistema. Esto mismo lo podemos ver en el siguiente dibujo.
Ilustración 1 Esquema recuperación documentos. Fuente:[Baeza-Yates 1999]
Etiquetas:
Búsqueda y Recuperación de Información,
Información,
Recuperación De Información,
relevancia,
sistemas de recuperación de información,
SRI,
Universidad de la Salle
El cálculo de la relevancia
Existen dos métodos para calcular la relevancia, uno manual y otro conocido como polling :
- Manual: consiste en la exploración de los documentos uno a uno para saber si se adecúan o no como respuesta a una pregunta. Muchas veces establecer la relevancia de un documento para una pregunta determinada resulta difícil y los especialistas no se ponen de acuerdo, por ello, es conveniente que los juicios los haga más de uno, y a ser posible un número impar de especialistas. El principal problema que presenta este método, es que en colecciones muy grandes, hay que invertir gran cantidad de tiempo, lo que supone mucho dinero para realizar esta operación y esto no siempre es posible. Además, algunas bases de datos son más especializadas que otras, lo que hace necesario contar con un número mayor o menor de especialistas. Para solventar estos problemas se crean las colecciones experimentales, donde se fija de antemano qué documentos son relevantes para cada pregunta.
Estas colecciones suelen tener un tamaño medio y suelen pertenecer a una misma área temática o muy próxima para que no sea necesaria la intervención de muchos especialistas.Un ejemplo de una colección manual es la de Crandfield [Cleverdon 91]. En este caso se buscaron los artículos y se les pidió a los autores que elaboraran preguntas cuya respuesta fuera su artículo y también se les pidió que citaran otros artículos que correspondieran a esa misma pregunta que ellos habían formulado. Con las preguntas y los artículos citados por los autores se elaboró la base de datos, la colección de preguntas, y los juicios de relevancia.
- Polling : cuando las bases de datos son muy grandes, y no es posible evaluar uno a uno los documentos, para determinar cuáles son los documentos relevantes, se recurre al "polling". Lo que se hace es analizar de manera manual un número determinado de documentos recuperados con distintos sistemas, este número suele ser elevado (varios centenares) y se corresponde con los primeros documentos recuperados con cada sistema. Este conjunto de documentos es el que de manera manual analizan los expertos, que son los encargados de decir en último término si son relevantes o no. Este sistema asume que la gran mayoría de los documentos relevantes son encontrados, si no por todos los sistemas, sí al menos por alguno de ellos, y los no recuperados pueden considerarse como no relevantes Kowalski 97].
De esta manera no es necesario evaluar toda la base de datos, pero aún así el sistema es fiable ya que el número de documentos que se suele examinar es elevado. Este sistema es el que se viene utilizando en las TREC desde 1994 [Harman 95].
http://www.hipertext.net/web/pag238.htm#La%20relevancia
Etiquetas:
bases de datos,
Información,
Recuperación De Información,
relevancia,
Sistemas de información y documentación,
Universidad de la Salle
El Proceso de Recuperación de Información
Traslación de las necesidades del usuario al lenguaje documental propio de la fuente a utilizar en cada caso. Es posible, además, encontrar fuentes en las que no se utilice ningún tipo de vocabulario controlado, en cuyo caso resultará necesario afinar el trabajo terminológico.
Traducción de la expresión de lenguaje documental al lenguaje de interrogación propio de cada sistema.
Ejecución de las expresiones del lenguaje de interrogación obtenidas.
Consulta de las respuestas obtenidas, para analizar su pertinencia o no a la cuestión planteada.
Replanteamiento, si procede, de las expresiones utilizadas, si los resultados obtenidos no son pertinentes.
Selección y obtención de los documentos que respondan a las necesidades manifestadas por el usuario.
Transmisión del resultado, preparado adecuadamente, al usuario.
Desde este enfoque, la utilización de un conjunto de ecuaciones de consulta es más una táctica, siendo la estrategia la planificación de consulta de fuentes, los criterios de selección de las mismas, etc.
Traducción de la expresión de lenguaje documental al lenguaje de interrogación propio de cada sistema.
Ejecución de las expresiones del lenguaje de interrogación obtenidas.
Consulta de las respuestas obtenidas, para analizar su pertinencia o no a la cuestión planteada.
Replanteamiento, si procede, de las expresiones utilizadas, si los resultados obtenidos no son pertinentes.
Selección y obtención de los documentos que respondan a las necesidades manifestadas por el usuario.
Transmisión del resultado, preparado adecuadamente, al usuario.
Desde este enfoque, la utilización de un conjunto de ecuaciones de consulta es más una táctica, siendo la estrategia la planificación de consulta de fuentes, los criterios de selección de las mismas, etc.
Etiquetas:
consulta de información,
lenguaje documental,
Recuperación De Información,
Sistemas de información y documentación,
Universidad de la Salle
La relevancia
Uno de los principales problemas en R.I. es la variedad de interpretaciones de algunos conceptos, como es el caso del de relevancia [Mizzaro 98].
Es importante definir este concepto, porque está en la base del resto de las medidas que tradicionalmente se vienen aplicando en R.I.. Aunque se formuló entre los años 30-40 no se utilizó experimentalmente hasta el test de Crandfield.
El concepto de relevancia se ha estudiado desde distintos puntos de vista [Saracevic 97] : lógica, filosofía, psicología, semantica, documentación... Estos enfoques los podemos resumir en dos tendencias: la relevancia objetiva y la subjetiva. La primera hace hincapié en los sistemas, normalmente define cómo la materia de la información recuperada coincide con la de la pregunta. La subjetiva, es la que tiene en cuenta al usuario [Swanson 86]. Dentro de este enfoque está la relevancia mirada desde el punto de vista del usuario [Schamber 90], [Wilson 73]. Para Schamber la relevancia se refiere a la utilidad, o potencial uso de los materiales recuperados, con relación a la satisfacción de los objetivos, el interés, el trabajo o los problemas intrínsecos del usuario.
En la relevancia subjetiva, se estudia desde el punto de vista de la información nueva que consigue un usuario de un documento. Según este concepto, la información conocida no es relevante [Boyce 92]. Hay autores a caballo entre estas dos tendencias, para los que la relevancia tiene un componente objetivo y otro subjetivo. Así Barry [Barry 94], determina la relevancia de un documento en función de siete criterios (1. Información que contiene un documento; 2 experiencia previa del usuario; 3 creencias y preferencias del usuario; 4 otras informaciones y fuentes; 5 fuentes del documento; 6 documento como entidad física; 7 situación de los usuarios) de los cuales dos son objetivos (1 y 5) y cinco subjetivos (2, 3, 4, 6 y 7).
Harter [Harter 96] indica que el principal problema de los estudios sobre los factores que afectan a la relevancia es que se han hecho de manera intuitiva, tal vez esto sea debido la variedad de interpretaciones de este término.
Muy ligado al concepto de relevancia está el de pertinencia; con frecuencia se entremezclan y confunden. Según Korfhage [Korfhage 97], relevancia es la medida de cómo una pregunta se ajusta a un documento , (esta visión coincide con el enfoque de la relevancia objetiva) y pertinencia es la medida de cómo un documento se ajusta a una necesidad informativa (lo que otros autores definen como relevancia subjetiva).
Es decir, según este autor, la diferencia entre uno y otro radica en cómo expresamos la necesidad de información, por lo tanto, a la hora de establecer la relevancia tenemos que tener en cuenta la doble dificultad que lleva implícita la pregunta, porque tiene que ser el reflejo de la necesidad informativa (de ella dependerá la pertinencia) y al mismo tiempo tiene que ser adecuada para la búsqueda de los documentos que resuelvan la necesidad informativa, ya que la relevancia va a depender directamente de la formulación concreta de la demanda informativa. A pesar de que Korfhage establece esta distinción entre relevancia (relevancia objetiva) y pertinencia (relevancia subjetiva), no todos los autores siguen esta línea, sino que algunos los utilizan como sinónimos.
En el caso de los trabajos en español muchas veces se han traducido los dos términos indistintamente para referirse a los dos conceptos. La valoración de la pertinencia es mucho más difícil de realizar ya que es el propio usuario el único que sabe si un documento se ajusta a su necesidad o no. Además la pertinencia en un mismo usuario cambia de un momento a otro, ya que la información conocida no es pertinente, puesto que no resuelve la necesidad informativa.
Para calcular la relevancia, lo más habitual es establecer valores binarios: un documento es relevante, es decir, sirve como respuesta a nuestra pregunta, (valor 1) o no sirve (valor 0), aunque también se puede fijar una gradación, y establecer una escala ordinal para medir la relevancia de los documentos [Cuadra 67]. El problema de determinar una escala es que no hay una guía clara para elaborarla. Por ejemplo Keen [Keen 71], usa cuatro valores de escala, para dividir del más relevante al menos relevante. Saracevic [Saracevic] [88] da tres valores a su escala: relevante, parcialmente relevante y no relevante, pero en la práctica distinguir entre un documento relevante y uno parcialmente relevante es muy difícil.
http://www.hipertext.net/web/pag238.htm#La%20relevancia
Etiquetas:
documento,
fuentes del documento,
Información,
necesidad informativa,
Recuperación De Información,
relevancia,
Sistemas de información y documentación
jueves, 2 de septiembre de 2010
Recuperación de Información
El proceso de recuperación se lleva a cabo mediante consultas a la base de datos donde se almacena la información estructurada, mediante un lenguaje de interrogación adecuado. Es necesario tener en cuenta los elementos clave que permiten hacer la búsqueda, determinando un mayor grado de pertinencia y precisión, como son: los índices, palabras clave, tesauros y los fenómenos que se pueden dar en el proceso como son el ruido y silencio documental. Uno de los problemas que surgen en la búsqueda de información es si lo que recuperamos es "mucho o poco" es decir, dependiendo del tipo de búsqueda se pueden recuperar multitud de documentos o simplemente un número muy reducido. A este fenómeno se denomina Silencio o Ruido documental.
Tomado de:
Tomado de:
http://www.mariapinto.es/e-coms/recu_infor.htm#ri1
Etiquetas:
búsqueda de información,
Recuperación De Información,
Sistemas de información y documentación,
Universidad de la Salle
miércoles, 1 de septiembre de 2010
Sistemas de Recuperación de Información
- Recuperación De Información
- Sistemas De Recuperación De Información
- Búsqueda Y Recuperación De Información
- Lenguajes De Recuperación De Información
- Metadatos
- Posicionamiento Web
Etiquetas:
Búsqueda y Recuperación de Información,
Lenguajes de Recuperación de Información,
Metadatos,
Posicionamiento Web,
Recuperación De Información,
sistemas de recuperación de información
jueves, 26 de agosto de 2010
La indización
Indización es el procedimiento que produce entradas en un índice.
Indización es el proceso de análisis del contenido informativo de registros de conocimiento (documentos) y la expresión de ese contenido en el lenguaje del sistema correspondiente.
Indización es la operación que tiene como propósito representar los resultados del análisis documental de un documento por medio de términos extraidos de un lenguaje documental.
Se pueden apreciar dos ideas básicas:
- El objetivo de la indización es representar (expresar, describir o indicar) el contenido (temas, características) de un documento.
- El proceso de indización tiene dos componentes: (a) análisis de contenido para seleccionar los conceptos que representarán los documentos; y (b) traducción o expresión de los conceptos seleccionados en el lenguaje utilizado por el sistema.
Por lo tanto hay que estudiar primero de qué trata el documento para extraer los conceptos y aplicar una estrategia de indización que permita traducir los conceptos. Esta estrategia debe tener en cuenta los puntos siguientes:
- Fuentes de procedencia de los términos: Tesauro, vocabularios, lenguaje natural.
- Especificidad: ¿Cuán específico debe ser un indizador al traducir un concepto a un término índice? ¿Debe el término seleccionado ser tan específico como el concepto? o ¿debería utilizarse uno más amplio? Por ejemplo: Un documento trata sobre los perros de raza Cocker Spanniel, pero se puede pensar que este término es demasiado específico para el sistema y entra en el índice con el término Perro, más amplio. Evidentemente esto depende del sistema documental, porque si se tratara de una base de datos sobre perros el término de entrada adecuado sería el primero.
- Ponderación: ¿Se puede expresar de alguna manera la importancia relativa de un concepto en un docuemento?
- Precisión: ¿Qué grado de precisión debe tener la traducción? ¿Qué hacer cuando no hay un término adecuado?
- Grado de coordinación: ¿Deben utilizarse términos simples o términos compuestos? Por ejemplo, el término Educación Infantil puede ser equivalente a la combinación de términos Educación e Infancia, cada uno de ellos por separado y combinables en la búsqueda.
- Exhaustividad: ¿Todo debe ser indizado?.
Objetivos y funciones de un índice.
- Identificar y localizar información potencialmente relevante en el documento o la colección indizada.
- Discriminar entre información sobre un tema y simples menciones al tema.
- Excluir menciones al tema que no aporten nada significativo a un usuario potencial.
- Analizar los conceptos tratados en el documento para proponer encabezamientos (entradas) adecuados basados en su propia terminología.
- Indicar relaciones entre temas.
- Agrupar o reunir materiales separados en la colección.
- Organizar encabezamientos y subencabezamientos y modificadores en entradas del índice.
- Dirigir al usuario hacia términos válidos por medio de reenvíos del tipo USE o Véase.
- Sugerir al usuario de un tema que vea también otros por medio de reenvíos como Véase también.
- Organizar las entradas en un orden sistemático que ayude al usuario.
La operación de Indización.
La indización comporta las operaciones siguientes:
- Planteamiento de objetivos: Contexto de trabajo.
- Conocimiento del contenido del documento.
- Elección de conceptos a representar: Selectividad (Retener aquellos conceptos sobre los cuales el documento aporta información susceptible de utilizar alusuario) Exhaustividad (Todos los conceptos útiles deben ser extraidos). El criterio principal de selección es el valor potencial del concepto escogido como elemento de expresión del tema del documento de cara a su recuperación.
Fenómeno: electricidad, lluvia ácida | ||||
Objeto: avión, trenes de cercanías | ||||
Documento legal: ley, sentencia | ||||
Materia: análisis documental, agricultura, | ||||
¿Qué? | estudio de..., cálculo de... | |||
Arquitectónica: La Alhambra | ||||
Materia | Obra | Literaria: La Odisea | ||
¿Cómo? | Pictórica: La rendición de Breda | |||
Proceso: Envejecimiento de la población | ||||
Cualidad: esfuerzo, optimismo | ||||
Propiedad: Flexibilidad, endurecimiento | ||||
Materiales: Cuero, polietileno | ||||
Político: Napoleón | ||||
Personaje | Artístico: Jorge Luis Borges | |||
¿Quién? | Personalidad | Ficticio: el Capitán Haddock | ||
Entidad: el Atlético de Madrid; Zara | ||||
Día: 14 de abril de 1912 | ||||
¿Cuándo? | Tiempo | Año: 1789 | ||
Siglo: XVI | ||||
Período: Holoceno, Años 60, 1936-1939 | ||||
Continente: Asia | ||||
Conjunto de países: Mercosur | ||||
País: México | ||||
Estado o provincia: Baviera | ||||
¿Dónde? | Lugar | Ciudad: Siena | ||
Barrio: Prosperidad | ||||
Calle: Corredera Alta de San Pablo | ||||
Río: Bidasoa | ||||
Cadena montañosa: Sierra Madre | ||||
Comarca: El Maresme | ||||
Mar: Mediterráneo | ||||
- Verificación de la pertinencia de los conceptos extraidos.
- Traducción de los conceptos escogidos al lenguaje documental del sistema. Los conceptos deberán traducirse por entradas del mismo nivel de especificidad o superior. Si el concepto es compuesto y existe la opción deberátraducirse por una entrada compuesta.
- Verificación de la pertinencia de los términos obtenidos planteándolos como términos posibles de interrogación y valorando si el documento es pertinente.
- Formalización de la descripción si el sistema prevé algún tipo de regla.
Tipología de índices:
Índices libres basados en palabras del texto: Son índices cuyas entradas están conformadas por palabras derivadas del texto mediante métodos extractivos. La tarea principal del analista es identificar las palabras candidatas a formar parte del índice.
- Índices de documentos individuales
- Índices de colecciones de documentos
- Índices esquemáticos
- Índices de palabras y nombres (concordancias)
- Índices permutados KWIC, KWOC, KWAC
- Índices de unitérminos (Taube)
- Índices de citas
Índices controlados basados en conceptos. Proceso intelectual de análisis comprensión de contenidos y traducción a lenguaje documental. Requieren el uso de un tesauro u otro lenguaje documental.
Indización mediante descriptores.
El método de indización por descriptores se basa en la suposición de que los contenidos semánticos (las materias o temas) de un documento pueden expresarse con suficiente precisión por una palabra o conjunto de palabras que cumplen una función nominativa. Estas palabras-clave o descriptores actúan de forma independiente y pueden combinarse entre sí utilizando los operadores lógicos booleanos. Generalmente se ofrecen en sistemas poscoordinados y suelen utilizar un tesauro.
Operadores lógicos:
- Intersección: la intersección de dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer a ambos conjuntos. Si tenemos el conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor LEGISLACION. La intersección entre ambos estará integrada por documentos que contienen ambos luego tratarán sobre Legislación cinematográfica. La intersección se suele expresar con los operadores siguientes:
CINE AND LEGISLACION
CINE Y LEGISLACION
- Unión: La unión de dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer a uno, otro o a los dos. Si tenemos un conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor TEATRO, el resultado será un conjunto integrado por todos los documentos de Cine y todos los de Teatro. La unión se suele expresar con los operadores siguientes:
CINE OR TEATRO
CINE O TEATRO
- Diferencia: La diferencia entre dos conjuntos da como resultado un nuevo conjunto integrado por elementos que cumplen la condición de pertenecer al primero pero no al segundo. Si tenemos un conjunto A, integrado por todos los documentos que tienen el descriptor CINE y el conjunto B, integrado por todos los documentos que contienen el descriptor ESPAÑA el resultado será un conjunto integrado por todos los documentos de Cine, menos los de Cine español. La diferencia se suele expresar con los operadores siguientes:
CINE NOT ESPAÑA
CINE NO ESPAÑA
Los descriptores son palabras o grupos de palabras incluidas en un lenguaje documental y escogidas de entre un conjunto de términos equivalentes para representar sin ambigüedad una noción contenida en un documento o en una petición de búsqueda documental. (Véase también el tema de los Tesauros)
Descriptor unitérmino o simple: Descriptor que representa un concepto mediante una sola palabra: CINE, OCIO, HIERRO, AUTOMOVIL
Descriptor sintagmático o compuesto: Descriptor que representa un concepto utilizando más de una palabra (un sintagma nominal o preposicional): COMUNICACION SOCIAL, PARTIDOS POLITICOS, MEDIOS DE TRANSPORTE, EMPRESA PRIVADA.
Descriptor primario: Término o conjunto de términos que representan un concepto de manera unívoca. Es significativo, relevante y no hay posibilidad de ambigüedad en su sentido, pudiendo aparecer aislado sin necesidad de aclaración. Cualquiera de los citados en las categorías anteriores es así.
Descriptor secundario: Descriptor que necesita ir acompañado de otros descriptores para expresar un significado preciso: ANALISIS, EVALUACION, CONCEPTO, TEORIA.
Descriptor temático: Representa cualquier contenido disciplinar.
Descriptor geográfico: Representa todo tipo de conceptos vinculados con lugares y sitios.
Descriptor onomástico: Representa un nombre de persona o de institución.
Descriptor cronológico: Representa períodos de tiempo o fechas.
Tomado de: Universidad Complutense de Madrid
Etiquetas:
búsqueda de información,
Información,
La indización,
lenguaje documental,
Recuperación De Información,
Universidad de la Salle
Suscribirse a:
Entradas (Atom)