viernes, septiembre 29, 2006

¿Recuperación de Información o Recuperación de Datos?

Continuando con la idea de presentar algunas partes del libro que he escrito con Gabriel Tolosa, titulado “Introducción a la Recuperación de Información”, ahora nos vamos a dedicar tratar las diferencias existentes entre recuperación de datos y recuperación de información.

Muchos usuarios se encuentran familiarizados con el concepto de recuperación de datos (RD), especialmente aquellos que – a menudo – interactúan con sistemas de consulta en bases de datos relacionales ó en registros de alguna naturaleza, como por ejemplo, un registro de los empleados de una organización. Sin embargo, hay diferencias significativas en los conceptos que definen que el tratamiento de las unidades (datos o información) en cada caso sean completamente diferentes.

Básicamente, existen diferencias sustanciales en cuanto a los objetos con que se trata y su representación, la especificación de las consultas y los resultados.

En el área de RD los objetos que se tratan son estructuras de datos conocidas. Su representación se basa en un formato previo definido y con un significado implícito (hay una sintaxis y semántica no ambigua) para cada elemento. Por ejemplo, una tabla en una base de datos que almacena instancias de clientes de una organización posee un conjunto de columnas que definen los atributos de todos los clientes y cada fila corresponde a uno en particular. Nótese que cada elemento (atributo) tiene un dominio conocido y su semántica está claramente establecida. Por otro lado, en el área de recuperación de información (RI) la unidad u objeto de tratamiento es básicamente un documento de texto – en general – sin estructura.

En cuanto a la especificación de las consultas, en el área de RD se cuenta con una estructura bien definida dada por un lenguaje de consulta que permite su especificación de manera exacta. Las consultas no son ambiguas y consisten en un conjunto de condiciones que deben cumplir los ítems a evaluar para que la misma se satisfaga. Por ejemplo, en el modelo de bases de datos, las consultas especifican – entre otros – utilizando el lenguaje SQL (Structured Query Language) cuya semántica es precisa:

SQL // En lenguaje natural _
SELECT * // Seleccionar todos los clientes de
FROM Clientes // Chivilcoy que deban más de 10000 pesos
WHERE Localidad = “Chivilcoy” // (se sabe, por definición, que lo que deben
AND Saldo_Cuenta > 10000 // es su saldo de cuenta)

En este ejemplo, se puede ver la clara semántica de la consulta en SQL a partir de que se conoce que existe un atributo Localidad y otro Saldo_Cuenta y lo que cada uno representa. Sin embargo, esto no es tan directo ni tan simple cuando se trata de recuperar documentos en el contexto de la RI. En primer lugar, debido a que la necesidad de un usuario puede ser difícil de expresar. Por ejemplo, supóngase que se desea encontrar:

“Documentos que contengan información biográfica de los entrenadores de los equipos de fútbol de Argentina que ganaron más torneos en los últimos 10 años”

La primera dificultad consiste en construir una expresión de consulta que refleje exactamente esta necesidad de información del usuario. Especialmente, si se tiene en cuenta que para resolverla completamente quizá primero se requiera de conocer información parcial, por ejemplo, “ganaron más torneos en los últimos 10 años”. ¿Qué significa “ganaron más torneos”? Esta es una situación subjetiva y – en muchos casos – el sistema debe manejar estas cuestiones, junto con ambigüedades (por ejemplo, palabras cuyo significado está determinado por el contexto) e incompletitud de la mejor manera posible. De hecho, los documentos y las expresiones de consulta se interpretan de forma que el proceso de recuperación determine un grado de similitud entre éstos.

Finalmente, en un sistema de RD los resultados consisten en el conjunto completo de elementos que satisfacen todas las condiciones del query. Como la consulta no admite errores, el resultado es exacto, ni uno más, ni uno menos. Y el orden de aparición es simplemente casual (a menos que específicamente se desee ordenar por alguna columna), pero en todos los casos este orden es irrelevante respecto de la consulta y no significa nada, es decir, no se puede implementar sistema de rankeo alguno. En el área de RI, aparece el concepto de relevancia y la salida (respuesta) se encuentra confeccionada de acuerdo a algún criterio que evalúa la “similitud” que existe entre la consulta y cada documento. Por lo tanto, el resultado es un ranking (que no es sinónimo de “orden”, tal como se lo entiende habitualmente en RD), donde la primera posición corresponde al documento más relevante a la consulta y así decrece sucesivamente. El proceso de recuperación de información puede retornar documentos que no sean relevantes para el usuario, es decir, que el conjunto de respuesta no es exacto.

A continuación, se resumen las diferencias más significativas entre un SRI y un sistema de RD como lo es un Sistema de Gestión de Bases de Datos (SGBD).

SGBD
Estructura: Información estructurada con semántica bien definida.
Recuperación: Determinística. Todo el conjunto solución es relevante para el usuario
Consulta y Lenguaje: Especificación precisa (no hay ambigüedad). Lenguaje formal, preciso y estructurado.
Resultados: Aciertos exactos


SRI
Estructura: Información semi o no estructurada.
Recuperación: Probabilística. Una porción de los documentos recuperados puede no ser relevante.
Consulta y Lenguaje: Hay imprecisión en su formulación. Lenguaje natural, ambiguo y no estructurado.
Resultados: Aciertos parciales


Otros autores también establecieron las diferencias entre ambos conceptos: Grossman y otro [Grossman] claramente muestran la diferencia cuando enuncian que “la recuperación de información es encontrar documentos relevantes, no encontrar simples correspondencias a unos patrones de bits”. Nótese la diferencia sustancial que existe en tratar de encontrar documentos “relevantes” a una consulta o – simplemente – encontrar aquellos donde “coinciden” patrones de términos o se cumplen ciertas condiciones. En el caso de la RD, la tarea es relativamente sencilla, mientras que en área de RI es extremadamente compleja y no existe aún una solución definitiva al problema.

[Grossman] Grossman, D. y Frieder, O. “Information Retrieval. Algorithms and Heuristics”. Kluwer Academic Publishers. 1998.

jueves, septiembre 28, 2006

Off topic: En una democracia no hay lugar para desapariciones

Quiero publicar esta triste noticia de mi país Argentina. El señor Julio Jorge López fue testigo en el juicio al represor Miguel Etchecolatz (ya juzgado y condenado), desde hace varios días está desaparecido y es buscado en todo el país.

Creo que esta no es una noticia más, es un hecho en si que una democracia no puede tolerar, si alguien conce al señor de la foto por favor comuníquese con la policía.

miércoles, septiembre 27, 2006

Honestidad académica

En el blog Digizen hay un interesante artículo de reflexión sobre el plagio en instituciones de educación superior. En estas épocas, de valores subvertidos, recomiendo su lectura.

CLEF 2006 -Cross Language Evaluation Forum

Ha finalizado el evento CLEF 2006, el cual fue realizado en Alicante (España). En la página del programa del evento hay algunas presentaciones.

Congreso Internacional: Oportunidades en la Sociedad de la Informació

La gente de Infoxicacion está haciendo la promoción del IV Congreso Internacional: Oportunidades en la Sociedad de la Información. El evento lo organiza la Universidad de Costa Rica y se realizará entre el 8-10 de noviembre del 2006.

Cronología de los servicios de búsqueda (1945-2006)

Un artículo del blog Search Marketing titulado "History of Search Engines: From 1945 to Google 2006" presenta una breve cronología sobre el desarrollo de los motores de consulta.

Directorio de software relacionado con la recuperación de información

Karpanta
Motor de recuperación de información experimental desarrollado por el Grupo Reina (Universidad de Salamanca).

Okapi
Software de indexación de colecciones de documentos.

Bow
Es una herramienta, diseñada por Andrew McCallum's, destinada a ayudar al estudio de modelos de lenguaje, recuperación de información, clasificación y agrupamiento de documentos. Se distribuye en código fuente bajo licencia GNU. h

TnT
Etiquetador léxico que corre sobre plataformas Solaris y Linux.

Editor XML
jEdit: es un editor de archivos en formato XML de licencia libre. Oisee plugins para sopòrtar extensiones del lenguaje.

CLUTO
Paquete orientado a tareas de análisis de conglomerados (clustering). Corre en plataformas Linux, Sun y Windows 2000.

NLTK
Clasificador que incorpora diversos métodos (Naive Bayes, MaxEnt, etc). t

Orange
Software de minería de datos desarrollado en C++. Incluye técnicas de SVM, análisis de conglomerados, regresión logística, etc.

WebSPHINX
Web crawler de uso moderado.

Balie
Herramienta destinada a la extracción de información.


SWISH-E
Motor de consulta.

XML Query Engine
Motor de consulta que indexa documentos en formato XML. h

ht://Dig
Motor de consulta de uso popular.

Snowball
Herramienta para desarrollo de stemmers.

Weka
Software de soporte a la minería de datos. Desarrollado en java.

MG
Managing Gigabytes, software de recuperación de información.

Lucene
Motor de consulta freeware, codificado en Java.

martes, septiembre 26, 2006

Sexual and pornographic web searching: trend analysis

La Doctora Amanda Spink, reconocida investigadora sobre conductas de usuarios frente a un motor de búsqueda, ha presentado un nuevo trabajo de investigación titulado “Sexual and pornographic web searching: trend analysis”. Desde el título el trabajo es seductor, pero más allá de las bromas el estudio trata de medir la intensidad de las búsquedas pornográficas o sexuales en motores de consulta desde el año 1997 al año 2005. Como dato relevante derivado de la investigación se concluye que tal intensidad ha disminuido y que actualmente representan un porcentaje menor al 4%.

lunes, septiembre 25, 2006

Revista de Ciencias de la Información

La Facultad de Letras y Ciencias Humanas de la Pontificia Universidad Católica del Perú, edita Alexandrí@ la cual es la Revista Electrónica de Ciencias de la Información. En ella se presentan artículos relacionados con la bibliotecología y la sociedad del conocimiento.

Telos: Cuadernos de comunicación, tecnología y sociedad

Les quería recomendar una revista electrónica llamada TELOS que en el número actual se trata exclusivamente el tema de los weblogs. Les copio el índice:

Un tutorial sobre blogs. El abecé del universo blog, Antonio Fumero
El poder tecnológico de los infociudadanos. Diarios y conversaciones en la Red Universal Digital, Fernando Sáez Vacas
Blogs vs. MSM.Periodismo 3.0, la socialización de la información, Juan Varela
Blogs y empresa. Una aproximación a la vanguardia de la blogosfera corporativa, Enrique Dans
Blogs para educar.Usos de los blogs en una pedagogía constructivista, Tíscar Lara
El blog en la literatura.Un acercamiento estructural a la blogonovela, Hernán Casciari
El papel de los blogs en la acción social.Blogs en ONG, una oportunidad poco conocida, Olga Berrios
Métrica de la blogosfera.Algunas medidas y relaciones en la blogosfera hispana, Juan Julián Merelo y Fernando Tricas
Anatomía de los blogs.La jerarquía de lo visible, Adolfo Estalella

domingo, septiembre 24, 2006

Recuperación de información en la década de 1940 “La máquina Memex”

Memex (Memory Extender System) fue una máquina teórica desarrollada por Vannevar Bush en el año 1945, su objetivo era almacenar y recuperar información de forma análoga a la memoria humana. El invento en cuestión fue publicado en la revista Atlantic Monthly bajo el título Monthly “As We May Think” en el año 1945. En tal artículo, Bush conciente de la proliferación del fenómeno conocido como “saturación de información” propone una máquina personal que asista a los individuos en una forma similar a la de nuestra memoria, es decir trabajando por asociación de conceptos.

En las palabras de su autor Memex era "...una máquina conceptual capaz de almacenar amplias cantidades de información, en la que los usuarios tienen la posibilidad de crear información, pistas o senderos de información, enlaces a textos relacionados e ilustraciones, datos que pueden ser almacenados y utilizados en futuras referencias.." y por otro lado “... en Memex una persona guarda sus libros, archivos y comunicaciones, dotado de mecanismos que permiten la consulta con gran rapidez y flexibilidad. Es un accesorio íntimo y ampliado de la memoria..."

La máquina de Bush almacenaría información de todo tipo (libros, documentos, transcripciones, anotaciones personales, etc) en una suerte de microfilms, los cuale se agregan en orden cronológico. Se asocian entre si a partir de vínculos o enlaces (trails) que se comportarían de forma semejante a la memoria de los humanos dado que se crean cuando se incorpora nueva información al sistema. La recuperación también estaba basada en asociación, dado que a partir de un concepto se recuperaban aquellas porciones de información (documentos en la forma tradicional) relacionadas con el mismo.

Dado el poco desarrollo de la informática en el momento de su invención, como así también la pobre oferta en dispositivos de almacenamiento y periféricos, hicieron que la máquina sea imposible de implementarse y quede como un prometedor diseño. A la fecha, Bush es reconocido como uno de los precursores del concepto de lectura no lineal, es decir la basada en hipertexto.

Vannevar Bush. “As We May Think”. The Atlantic Monthly, Vol. 176, No. 1, 101-108, july 1945

sábado, septiembre 23, 2006

Off Topic: Cuento Tecnológico

Gracias a mi compañero Javier por hacerme reir y reflexionar un rato. Comparto con ustedes un pequeño cuento popular que trata sobre tecnología:

Algunas veces es un error juzgar el valor de una actividad simplemente por el tiempo que toma realizarla...

Un buen ejemplo es el caso del ingeniero que fue llamado a arreglar una computadora muy grande y extremadamente compleja... una computadora que valía 12 millones de dólares. Sentado frente a la pantalla, oprimió unas cuantas teclas, asintió con la cabeza, murmuró algo para sí mismo y apagó el aparato.

Procedió a sacar un pequeño destornillador de su bolsillo y dio vuelta y media a un minúsculo tornillo. Entonces encendió de nuevo la computadora y comprobó que estaba trabajando perfectamente.

El presidente de la compañía se mostró encantado y se ofreció a pagar la cuenta en el acto. ¿Cuánto le debo? -preguntó. Son mil dólares, si me hace el favor.

¿Mil dólares? ¿Mil dólares por unos momentos de trabajo? ¿Mil dólares por apretar un simple tornillito?

¡Ya sé que mi computadora cuesta 12 millones de dólares , pero mil dólares es una cantidad disparatada! La pagaré sólo si me manda una factura perfectamente detallada que la justifique. El ingeniero asintió con la cabeza y se fue.

A la mañana siguiente, el presidente recibió la factura, la leyó con cuidado, sacudió la cabeza procedió a pagarla en el acto, sin chistar. La factura decía:

Servicios prestados:

Apretar un tornillo................. 1 dólar
Saber qué tornillo apretar.......... 999 dólares

Este cuento se dedica a aquellos profesionales que día a día se enfrentan con la desconsideración de quienes por su propia ignorancia no alcanzan a entenderlos y regálales al menos un momento de humor.

Moraleja "En ciertas profesiones u oficios se gana por lo que se sabe, no por lo que se hace".

Discos rígidos de 2,5 TB de capacidad en el 2009

Seagate ha anunciado la finalización del desarrollo de una nueva tecnología con la que se ha logrado almacenar hasta 421 Gb por pulgada cuadrada. EL efecto de este desarrollo se dará en que será posible tener discos rígidos de 2,5 TB (esto se espera que suceda en el 2009). Gracias Abadía Digital.

viernes, septiembre 22, 2006

Second International Workshop on Open Source Information Retrieval

El evento Open Source Information Retrieval Workshop, realizado en el marco del SIGIR, tiene por finalidad ser un facilitador de la difusion de tecnologías open source en recuperación de información. Todavía no están publicadas las presentaciones, hay que estar alerta a ello.

Pero por otro lado, si están publicadas las ponencias del OSWIR 2005 (2005 workshop on Open Source Web Information Retrieval).

Google Blogsearch

Es un servicio ofrecido por Google que tiene la particularidad de buscar solamente en sitios weblogs. Dado el dinamismo de este tipo de sitios, Blogsearch permite sindicar las consultas, ya sea por los primeros 10 o 100 resultados. Es interesante el filtro por antigüedad de los artículos.

jueves, septiembre 21, 2006

Algunas críticas al sistema de noticias votadas “Menéame”

Menéame es una especia de diario digital o top ranking de noticias, las cuales son propuestas y votadas por los usuarios del sitio. Una noticia cuanto más votos tenga estará más cerca de los primeros lugares y por ende tendrán mayor visibilidad.
En definitiva se puede decir que es la gente común la que arma su diario, proponiendo en forma democrática los temas más representativos de la comunidad. Como alternativa a los medios tradicionales, donde no siempre representan el verdadero interés de la gente a partir de su abanico de información que presentan diariamente, estos sistemas sociales deberían ajustarse de mejor forma al imaginario colectivo. Pero parece que no siempre es así, en el blog Cuarzo Mundo se presenta un post con una serie de críticas a Menéame.

Si son fallas verdaderas hay que ajustar el servicio y la convivencia. Los sistemas sociales de votos de noticias son una oportunidad que posee la gente común de autodefinir su agenda diaria informativa.

miércoles, septiembre 20, 2006

Modelo de ranking de blogs en español

Top Blog es un sitio dedicado a mantener un ranking de weblogs en español. Según consta en las FAQ del sitio “la puntuación de cada blog, que es la que determina la clasificación en el ranking, es la suma ponderada de los resultados de consultas sobre el blog a diversos motores de búsqueda, normalizada sobre un valor máximo”. Los buscadores y sus correspondientes pesos son:

Technorati = 1.5
Google.es = 1
Google Blog = 0.5
Google PR = 1.5
Alexa = 0.25
Yahoo.es = 0.25

En pocos día Google presentará en sociedad su procesador de textos colaborativo Writely

A partir de tener una cuenta en Writely, hoy me ha llegado un mail avisándome que en pocos días deberé utilizar mis datos de usuario Google para acceder al mencionado recurso. Esto significa dos cosas: a) que Writely ha pasado las pruebas con éxito y que b) ya estamos muy cercanos a que Google nos presente su WebOS. Adelante muchachos.

martes, septiembre 19, 2006

Plataforma tecnológica de publicación del diario El Mundo.es

Mauro, un colaborador de nuestro laboratorio, me ha hecho llegar la referencia a un interesante artículo escrito por el responsable técnico del diario español El Mundo, En el documento se relatan los seis años de experiencia de publicar la versión en línea del mencionado diario. Lo particular del relato se centra en que contra la corriente, este grupo de trabajo dirigido por Raúl Rivero, ha logrado éxito a partir de decir no al outsourcing y al decir si al software libre.

En particular, para la gente de informática recomiendo la lectura del artículo, no tiene desperdicio el ver como con un poco de ingenio y voluntad se pueden realizar buenos proyectos independientes.

Estado del mercado de buscadores

Hitwise ha publicado el estado del mercado de los buscadores ,con datos de agosto 2006, en Estados Unidos. También se ha publicado la lista de los 25 sitios top en USA. Es interesante ver como Yahoo se va posicionando en estos últimos tiempos.