Páginas

Mostrando entradas con la etiqueta investigación-DataScience. Mostrar todas las entradas
Mostrando entradas con la etiqueta investigación-DataScience. Mostrar todas las entradas

martes, 17 de junio de 2014

Github como el repositorio universal

Almacenar, acceder y descubrir datos de forma efectiva y eficaz es en esencia un problema común a prácticamente todas las disciplinas científicas. EN cada disciplina, la idiosincrasia de los datos, unido a la forma de trabajo y los métodos propios, hace que existan soluciones particulares para cada disciplina científica. Tomemos la comunidad SIG, la cual conozco bastante. Existe un servicio respaldado por un organismo internacional de normalización  (OGC) denominado Catalogue Service for Web (CSW) que define una interfaz de consulta para buscar y recuperar registros de metadatos asociados a recursos geográficos teniendo en cuenta criterios de búsqueda  de carácter espacio-temporal. Así mismo, el servicio CSW también especifica el modelo de datos interno para que cada uno de los registros del catálogo sea consultable de forma adecuada

La misma filosofía se aplica a otras disciplinas tan dispares como eGobierno, Unidades de Información, bioinformática, etc. las cuales disponen también de servicios similares en forma de registros o catálogos que albergan metadatos y permiten la búsqueda de recursos de acuerdo a las peculiaridades de cada disciplina.  Como no, estos servicios y sus respectivos modelos de datos e interfaces de consulta vienen respaldados por normas internacionales de estandarización.

Tanta estandarización parece que crea justo el efecto justo contrario: fragmenta. La investigación actual es multi-disciplinar por lo que es habitual que científicos de una disciplina necesiten recursos de otras disciplinas. Al final resulta que se necesitan nuevos estándares para que catálogos de distintas disciplinas se entiendan entre ellos para que la promesa todavía incumplida de eScience se convierte en realidad: acceso y búsqueda de recursos científicos multi-disciplinares. 

Y entonces llega Github. Una plataforma web online que nació como repositorio para el control de versiones de código fuente. El proceso de desarrollar una aplicación es arduo e iterativo. Un programador genera diversas versiones del código a medida que añade nuevas funcionalidades. En cada nueva versión, el programador documenta (metadatos de contexto) las nuevas funciones añadidas o qué errores ha solucionado. Si la nueva versión no le convence, entonces siempre puede recuperar el estado anterior del código, o el anterior del anterior. Github mantiene el control de versiones de todos los ficheros de código desde la creación de proyecto. Es un gran repositorio online que gestiona el ciclo de vida de un recurso de información. Lo poco que hace lo hace excepcionalmente bien. 

Encima de la funcionalidad básica, Github añade una capa social, la cual hace fácil crear comunidades espontáneas de desarrolladores: algunos contribuyen a proyectos de terceros, se permite la descarga de un repositorio de código pero con la diferencia que la copia maestra siempre la gestiona el propietario o creador del repositorio original. Y todo esto es posible con uno o dos clicks. 

El funcionamiento de Github parece el sueño de eScience para cualquier científico. Tener acceso a un inmenso repositorio de datos, donde se mantienen distintas versiones de los datos, se accede a cada una de las versiones, y se pueden descargar los datos localmente pero con la salvedad de que siempre se puede obtener la ultima versión de los datos yendo al repositorio original.  Venga ya! No me lo creo!

La comunidad ha encontrado multitud de usos nuevos y creativos para los que Github no fue inicialmente diseñado: desde control de documentos, imágenes, la escritura de libros colaborativa, hasta repositorios de datos de la administración pública, e incluso de datos geográficos.  ¿Necesitamos servicios altamente especializados pero estandarizados según la disciplina que no logran hablar entre ellos? ¿o servicios generalistas, pero con la capacidad de generar valor¿Para cuando un Github que permita el acceso, compartición  y recuperación de datos científicos multidisciplinares? 



sábado, 19 de abril de 2014

Las Vs de Big data: Sumario (y Parte 7)

Algunos meses atrás comenzábamos una serie de entradas sobre Big Data y unidades de información. La primera entrada de la serie terminaba con la siguiente nota:

La ciencia intensiva en datos necesita de herramientas, métodos y personal con miras analíticas para explotar convenientemente Big Data. A lo largo de las próximas semanas analizaremos las Vs que caracterizan a Big Data así como su valor e impacto para las Unidades de Información

A los largo de las ultimas semanas hemos ido revisando, mas bien comentando algunas ideas sin ser demasiado exhaustivo, las distintas dimensiones de Big Data, es decir las Vs, que se encuentran por doquier en la literatura, blogs y recortes de prensa: Volumen (parte 1), Variedad (parte 2) y Velocidad (parte 3).

A parte de estas tres archi-conocidas Vs, incluimos más Vs que a nuestro parecer son igualmente relevante para entender el alcance y complejidad de Big Data: Validez y Veracidad (parte 4), Valor (parte 5), y Visualización (parte 6).

Podríamos haber seguido con vulnerabilidad, etc. hasta agotar todas las palabras con Vs que se nos ocurriesen pero creamos que no es necesario. ¿Cogéis la idea, no? El tamaño no es tan importante como nos vende y nos pregona continuamente la industria y prensa especializada, que ha abusado excesivamente del término Big Data.

Cerramos esta serie con la presente entrada a modo de conclusión personal. A continuación anotamos algunas frases resumen en cuanto a las "verdades" (otra v!) de Big Data y algunos comentarios aplicados al caso particular de las unidades de información.

  • Los datos son fundamentales, ya sean big o small, pero secundarios. La pregunta a resolver es lo realmente prioritario. Debe existir un objetivo o problema bien definido para emprender un proyecto de este tipo. Luego, la ciencia en Data Science es lo primario, y no lo datos.
  • La inmensa mayoría de los proyectos a día de hoy no son Big Data. Se pueden resolver con la tecnología que ya existía antes del fenómeno Big Data. Esto no impide que se emplee tecnología como Hadoop para montar por ejemplo un cluster para computación en paralelo aunque la solución requerida fuera mucha más sencilla. Por la tanto, el uso de Hadoop (u otra tecnología relacionado con Big Data) no es condición suficiente para presumir de tener en marcha un proyecto Big Data.
  • Se tiene entre manos un proyecto de Big Data cuando cumple algunas (o incluso todas) de las tres primeras Vs: volumen descomunal de datos, variedad exponencial de datos, o velocidad incesante de entrada de datos. ¿Se encuentran las unidades de información y bibliotecas en un escenario que requiera computación en paralelo para atender a millones de usuarios? Puede que existan algunos casos en centros internacionales pero en territorio español decididamente no. Un estudio reciente muestra las carencias de la bibliotecas españolas en cuanto por ejemplo presencia web o disponibilidad de catálogos en línea, no hablemos pues de proyectos de Big Data. ¿Y en el futuro? Pues depende totalmente de la naturaleza de los futuros problemas que las bibliotecas tenga que acarar en el futuro. Si se convirtiesen en gestores de los datos generados en proyectos de investigación, por ejemplo, la cosa cambiaría radicalmente porque en ese escenario o bien el volumen, variedad o velocidad de entrada de datos a escalas exponenciales sería más que probable. 
  • Resulta mucho más interesante definir el equipo de un proyecto Big Data que el término en sí. Como hemos recalcado en la serie de entradas, el factor humano es decisivo para el éxito de un proyecto de este tipo. La tecnología es importante, pero ella sola no te salvará de la quema si no hay equipo. Definir un equipo con competencias complementarias que cubra todas las necesidad de un proyecto de Big Data es primordial pero nadie parece importarle. ¿Que alguien me diga si alguna biblioteca o unidad de información española tiene un estadístico, matemático, informático, o experto en visualización y comunicación de los datos entre su personal o colaborando con personal de la biblioteca?

viernes, 4 de abril de 2014

#sumario #bigdatajournals (04/04/2014)

Nuevas revistas académicas sobre Big Data: 

Big Data Research (Elsevier): 
It promotes Data Science and interdisciplinary collaboration between fields, and to showcase the benefits of data driven research, papers demonstrating applications of big data in domains as diverse as Geoscience, Social Web, Finance, e-Commerce, Health Care, Environment and Climate, Physics and Astronomy, Chemistry, life sciences and drug discovery, digital libraries and scientific publications, security and government.
EPJ Data Science (EPJ):
It covers a broad range of research areas and applications and particularly encourages contributions from techno-socio-economic systems, where it comprises those research lines that now regard the digital "tracks" of human beings as first-order objects for scientific investigation
 Big Data (Liebert Pubs):
It brings together the community to address current challenges and enforce effective efforts to organize, store, disseminate, protect, manipulate, and, most importantly, find the most effective strategies to make this incredible amount of information work to benefit society, industry, academia, and government.
Big Data & Society (SAGE):
It publishes interdisciplinary work principally in the social sciences, humanities and computing and their intersections with the arts and natural sciences about the implications of Big Data for societies.

miércoles, 2 de abril de 2014

Las Vs de Big data: Visualización (Parte 6)

De nada sirve generar valor a partir de los datos, grandes o pequeños, si al final no somos capaces de comunicar adecuadamente la información generada a quien la necesita. El término actionable information se refiere a información que puede llevar a acciones y decisión concretas. Si se fracasa en la Visualización, entendida como la comunicación eficientemente de la información y conocimiento obtenido mediante toda la cadena de Vs del Big data que hemos descrito a lo largo de estas series de entradas, entonces todo el esfuerzo realizado de recoger, filtrar, validar, verificar, analizar y dar valor a los datos pierde su fin, porque nadie va a beneficiarse para la toma de acciones y decisiones pertinente. 

El recorrido de transformar grande volúmenes de datos en bruto en información surge para dar respuestas a preguntas planteadas por un individuo o grupo. Por lo tanto, la comunicación eficiente, clara y efectiva de la información debe dar, al final de este recorrido de las Vs del Big data, respuestas concretas a estas preguntas. Si no se cuidan los aspectos de comunica, todo lo realizado pierde valor. 

Existen multitud de técnicas de visualización. Este requiere escoger el método y tecnología más idóneas dependiendo de quién deba interpretar la información presentada. Además de ser una forma eficaz de transmitir información, la visualización también se puede utilizar para otros fines. Por ejemplo, para atraer a un público o comunidad e incluso como expresión artística del Big data.

Las unidades de información y bibliotecas pueden sacar un gran rendimiento a usos creativos de la visualización de los datos, no únicamente para presentar la información escondida entre el Big data de forma clara e inteligible, sino como gancho para renovar el interés de una comunidad de usuarios en declive, y quizás lo más importante, para atraer a nuevos usuarios a las bibliotecas.

martes, 1 de abril de 2014

Las Vs de Big data: Valor (Parte 5)

Bien, ahora que ya he conseguido obtener los datos relevantes: ¿qué puedo hacer con ellos?. Encontrar pequeñas pepitas de oro escondidas y mezcladas entre montones de tierra y piedras es difícil. El valor (oro) en Big Data consiste en analizar los datos para encontrar relaciones y patrones ocultos, y nueva información entre los datos en brutos, erróneos y con cierto ruido (la tierra y las piedras).

Aquí está el verdadero potencial. Y aquí está también donde quedan muchas cosas por hacer. Los medios de comunicación a menudo exageran el potencial de lo que realmente es posible aquí y ahora, y hablan en términos de inferencia, predicción, minería de datos y causalidad. Estas técnicas  intentan generalizar (o inferir) lo que ocurre en grupo pequeño a una escala mayor. O describir o extraer información nueva y patrones desconocidos en conjuntos de datos pasados. O bien identificar que variables causan un cambio en otra variable independiente. O incluso para la predicción de resultados precisos. 

¿Las unidades de información y bibliotecas necesitan la dimensión Valor de Big Data? Creo que sí.  Cualquier institución o organización que tenga entre sus funciones primaras la recolección, almacenamiento y gestión de los datos es potencialmente susceptible de usarlos adecuadamente para extraer valor añadido. 

¿Las unidades de información y bibliotecas perciben la necesidad de la dimensión Valor de Big Data? La respuesta ya no parece tan clara como en la anterior cuestión. Hay mucho bombo publicitario que todavía impide entrever los casos pragmáticos, reales y de éxito que permitan evaluar los beneficios y las dificultades del Valor en Big Data 

¿Las unidades de información y bibliotecas están preparadas para sacar partido de la dimensión de Valor del Big Data? Aquí mi predicción es que no. Aunque los medios técnicos y la tecnología requerida (p.e. Hadoop) para abordar un proyecto de Big Data para extraer valor son importantes, el verdadero escollo es reconocer que un proyecto de esta índole requiere de un equipo multi-disciplinar, que agrupe informáticos, estadísticos, documentalistas, gestores de información, analistas de datos y otros perfiles que indiscutiblemente deberían formar parte de un proyecto tan creativo y a la tan vez complejo. Como también sucede con la Veracidad y la Validez de los datos, el factor humano se hace cada vez más necesario a medida que nos movemos desde los datos en brutos hacia la generación de información. 

¿Las unidades de información y bibliotecas perciben la necesidad de prepararse para sacar partido de la dimensión de Valor del Big Data? No parece que hayan agradables sorpresas y la tónica general es que no. Pero ahora mismo estamos trabajando en un pequeño proyecto para intentar dar una respuesta lo más objetiva posible a esta pregunta en el contexto español. Muy pronto resultados. 

  


miércoles, 26 de marzo de 2014

Las Vs de Big data: Validez y Veracidad (Parte 4)

Terminé la anterior entrada de la serie sobre Big Data con un referencia a la Validez y Valor. Ahora me centraré en la validez , y por extensión en la veracidad de la datos, dejando el valor para la próxima ocasión.

El proceso de generar conocimiento a partir de los datos en bruto no es sencillo. En la literatura se han propuesto multitud de metodologías al respecto que, aunque pueden variar ente disciplinas, en esencia transmiten el mismo mensaje: ¿De todos los datos que tengo a mi disposición, cuales son los datos realmente relevantes, y de calidad suficiente para mi propósito? Traducido en palabras mundanas, el eterno problema de separar el trigo de la paja. 

Una de las grandes contradicciones que encuentro cuando se habla de Big Data es el hincapié excesivo que se hace en esos dos términos. Los datos son importante, evidentemente, pero la clave no está en los datos en sí, sino en la ciencia que que permite responder (nuevo conocimiento, acciones concretas, decisión a tomar)  a preguntas planteadas (mi problema)  partiendo de los datos.  A mi modo de ver, me parece mucho mas interesante el término Data Science, con el acento en Science, que Big Data, donde no aparece ninguna mención a la ciencia y análisis necesarios para extraer nueva información y conocimiento.

La terminología del párrafo anterior viene a colación porque las tres primeras Vs (Volumen, Variedad, y Velocidad) hacen hincapié únicamente en los datos. No hay todavía ninguna preocupación sobre la validez de éstos, o si servirán finalmente para el problema que intento resolver. AL fin y al cabo recojo esos datos porque tengo una intuición que me puedan servir luego. Imaginad que hemos conseguido recopilar una cantidad asombrosa de datos, del orden de cientos de TeraBytes. Realmente una cosa Big. Pero después de tediosas revisiones de los datos, nos damos cuenta que no sirve una pequeña porción de esos Terabytes . ¿Significa esto que ya no se trata de un proyecto de Big Data? Atendiendo a la cantidad de los datos antes y después de la revisión parece que sí. Como comentaba al principio de la entrada, los datos no son tan importante por sí mismo, y menos aún su cantidad relativa. Lo interesante y a su vez más complejo del Big Data es la ciencia que permite reducir esa cantidad brutal de datos de estrada a aquellos datos válidos y relevantes que generarán nueva información. 

Con la Validez, nos adentramos en aspectos de Big Data menos cristalinos que las Vs anteriores. ¿Son los datos correctos? ¿Son de calidad suficiente? ¿Me sirven datos que tienen distinta precisión, o diferencias significativos en la cobertura o escala espacial y temporal? ¿Son relevantes para mi problema? ¿Me pueden conducir a información "actionable" al final del día?.

Unido estrechamente a la validez, se encuentra la Veracidad de los datos: ¿Puedo confiar en datos que provienen de fuentes dudosas, no oficiales? ¿Quién responde por los datos? ¿A quién puedo preguntar? Si esos datos conllevan un error durante su captura ¿soy consciente de ese error? ¿Cómo se propaga ese error?. A todos nos resulta familiar que cuando vamos al médico, la visita queda registrada en nuestro historial médico así como cada una de las vistas anteriores. ¿Cuando fuimos? ¿Quién nos atendió? ¿Cuáles fueron los síntomas, el diagnóstico y el tratamiento?. A nadie se le escapa por ejemplo que el historial médico es fundamental para que el doctor pueda realizar un buen diagnóstico (información, conocimiento)  y  entonces aplicar un tratamiento conveniente para la dolencia diagnosticada (acciones, decisiones) ¿Conozco el "historial" de los datos y todas las "operaciones" que han sufrido hasta llegar a mis manos? ¿Puedo confiar en datos de los que desconozco cómo han sido tratados o procesados anteriormente? ¿En qué contexto fueron creados o modificados los datos para que los pueda interpretar correctamente?.

La Validez y Veracidad son fases críticas en Big Data porque preparan los datos para la fase posterior de Valor. Aunque algunos aspectos pueden ser automatizados, el contexto que requiere es tan complejo que el factor humano es imprescindible  en esta fase de verificación y fiabilidad para decidir que datos sirven y cuáles no. Por lo tanto, que nadie espere a corto plazo aplicaciones y herramientas de un solo click con un botón "Validad y Verifica tus datos", pero que tampoco espere que personal sin preparación especifica pueda afrontar con éxito estas tareas. Lo bueno, el factor humano es necesario en combinación con la tecnología . La malo ¿el personal de las bibliotecas está lo suficientemente preparado y especializado para validar y verificar flujos continuos de grandes cantidades de datos, de distinta naturaleza, tipología y origen?

domingo, 16 de febrero de 2014

Las Vs de Big data: Velocidad (Parte 3)

Tras el Volumen y la Variedad, seguimos con la serie de las Vs que caracterizan a Big Data para las Unidades de Información con la V de Velocidad

La velocidad con la que se producen datos es otra característica de Big Data que promete, si no lo es ya, en convertirse en reto. Uno de los grandes problemas derivado de tener grandes cantidad de datos, de diversa índole y producidos continuamente, es la escasa capacidad de análisis. Algunos comentarios ya han hecho notar el notable diferencial entre la cantidad de datos que somos capaces de almacenar, con respecto a la cantidad de estos (mucho menor) que somos capaces de analizar. Esto se traduce en que muchos datos de entrada no pueden ser analizados y por lo tanto no se les puede extraer valor (próxima V de la serie). Valor desde mi punto de vista es la auténtica V de Big Data. Unido a esto, la tendencia es que esta diferencia entre datos recogidos y analizados se incremente con el tiempo, luego el problema, lejos de solucionarse en el corto tiempo, va a ir a más.

Se me ocurren un par de estrategias simples para intentar abordar el problema anterior. 

La primera consistiría en reducir la cantidad de datos de entrada, para que la cantidad de datos que se va analizar se adecue a la capacidad real de análisis. ¿Tiene sentido que las bibliotecas almacenen todo el flujo de datos que les llega? ¿Cada uno de los resultados de investigación? ¿O se deberían aplicar filtros de calidad y forzar la colección de resultados de investigación agregados, procesados en vez resultados en bruto, para restringir así el volumen de entrada de datos? ¿Facilitaría lo anterior tareas posteriores de análisis, búsqueda y preservación? 

La segunda es poner hincapié en aumentar la capacidad de análisis. A primera vista parece un aspecto únicamente tecnológico: mejorar capacidad de cálculo, algoritmos avanzados, etc. Pero creo que la capacidad de análisis en Big Data, entendido como el medio para encontrar valor y conocimiento de los datos de entrada, tiene un componente humano vital . Los bibliotecas no parece que se están preparando, tanto a nivel tecnológico como humano, para afrontar este nuevo contexto de Big Data. 

Las tres Vs -Volumen, Variedad y Velocidad-, que para muchos definen Big Data, rascan muy ligeramente el verdadero potencial del Big Data, ya que están más cerca del dato que de la promesa del conocimiento que esperamos obtener con Big Data. En una próxima entrega nos meteremos de lleno con la Validez y el Valor, las Vs que se aproximan cada vez al verdadero propósito del Big Data: generar conocimiento a partir de datos.

miércoles, 11 de diciembre de 2013

Las Vs de Big data: Variedad (Parte 2)

Seguimos con la serie de las Vs que caracterizan a Big Data para las Unidades de Información con la V de Variedad

Como ocurría con el Volumen, la Variedad es una cualidad de Big Data que no necesita mucha más explicación adicional.  La variedad de datos de los cuales se puede "sacar jugo" es cada vez mayor, y de algún modo correlaciona con la cantidad de distintas fuentes generadoras de datos.  
Los datos generados por la multitud de sensores estáticos desplegados en las ciudades: sensores de movimiento, video-cámaras, térmicos, infrarrojos, de medición de la calidad del aire, del sonido, de condiciones medioambientales, etc.>

Los datos generados por los sensores humanos mediante el uso de las redes sociales, y las que están por venir.

Los datos generado por los nuevos dispositivos, dejando al smartphone de lado, como los relojes, gafas, brazaletes, la televisión y ropa "inteligente" repleta de nuevos mini-sensores que monitorizarán nuestra actividad diaria y la de nuestro entorno. 

Los datos generados por literalmente cualquier cosa (o "thing") que te puedas imaginar, y que tenga la capacidad de dialogar con otras cosas para captar/transmitir datos. La Internet de las Cosas promete ser un generador continuo de flujos de datos de cualquier índole. 

Los datos generados por lo que vienen siendo los proveedores tradicionales, como instituciones y agencias públicas, unidades de información, bibliotecas, organismos científicos, etc., que obviamente siguen teniendo su tirón e importancia como proveedores de datos ante en el mundo dominado por los datos de "ahora y aquí" captados por los distintos tipos de sensores mencionados arriba.

Los datos generados por los sensores equipados en tu dispositivo móvil, que llevas en tu bolsillo a todas partes. Aparentemente son pocos,  pero multiplicados por unos cuantos millones en todo el mundo, la cantidad y variedad de datos va in crescendo con el paso del tiempo. Sin duda alguna.

Ante la era de los sensores por doquier,  no cabe duda que los datos generados serán de lo más variado, en cuanto a formato, contenido, estructura, semántica, resolución espacial, resolución temporal,  y mucho, mucho ruido intercalado para hacer el cóctel mas interesante.

Las bibliotecas e unidades de información afrontan un gran reto desde la perspectiva de la gestión de estas colecciones tan variadas. Desde la parte tecnológica, Big Data promete poner orden en todo ese caos de tipos heterogéneos de datos. Eso está aún por ver, pero tampoco es la responsabilidad de las bibliotecas y unidades de información. Sin embargo, en cuanto a la parte que les atañe, el reto supone casi un cambio disruptivo en aptitud, mentalidad , y saber hacer del oficio. A diferencia del pasado y presente actual, el saber adaptarse y vivir con la variedad, incertidumbre, y dinamismo de las colecciones de datos actuales será clave para posicionar otra vez a las unidades de información y bibliotecas como centros de referencia en la gestión de la nueva ola de colecciones. Sin una voluntad de cambio hacia la variedad, quedarán exiliadas de la era de los sensores.

miércoles, 13 de noviembre de 2013

Las Vs de Big Data: Volumen (Parte 1)

Comezamos la serie de las Vs que caracterizan a Big Data para las Unidades de Información con la V de Volumen

Big data implica grandes volúmenes de datos que crecen a ritmos exponenciales. Se cuenta que cada día se generan enormes cantidades de datos nuevos. Cualquiera puede intuir que volumen es una característica de Big Data que ya se sobreentiende. Lo primero que a uno le cruza la mente al leer el término Big Data es justo la referencia al tamaño: enormes conjuntos de datos. Es cierto, sin lugar a dudas se publican cientos de miles de artículos científicos al año, millones de contenido multimedia se comparte en redes sociales, los satélites capturan continuamente imágenes satélites de la tierra, intercambios de ficheros, por no hablar de la avalancha de datos que se generaran cuando los sensores inteligentes (monitorizando ciudades, bosques, cualquier rincón de la tierra e incluso a uno mismo) y el internet de las cosas alcancen un nivel de madurez aceptable. En total, muchos, muchos datos al día.

La Biblioteca del Congreso anunció en 2010 un plan para almacenar cada tuit desde 2006. Tan solo cuatro años después este proyecto, que parecía estancado por la dificultad técnica y los recursos económicos necesarios para almacenar todos esos datos, quizás podría materializarse más rápidamente hoy porque los costes de almacenamiento literalmente tienden a cero y la disponible de herramientas especializadas (algunas sin coste) para almacenar grandes volumen de datos no estructurados. Parece que big data puede solucionar el retraso de unos cuantos años en la Biblioteca del Congreso.

Sin embargo  podemos dar un paso atrás, tomar un poco de aire y perspectiva, y ser un poco críticos antes de dejarnos arrastrar ciegamente por la corriente mediática del Big Data.  

Primero, el big de hoy será el small de mañana.  La percepción de cuanto unos datos son Big varía en función del campo de estudio. Por ejemplo, en GI (información geográfica), los grandes conjuntos de datos son intrínsecos a la disciplina desde sus comienzos. Además, Big es algo dependiente del contexto actual. Tengamos claro pues que seremos capaces de generar datos “superbig” en los años venideros y miraremos atrás para darnos cuento de lo "small" que eran los datos entonces.  

Segundo, cuanto mayor sea la cantidad de datos almacenados, mejores decisiones se podrán tomar para mejorar la sostenibilidad, eficiencia y eficacia de los servicios públicos de las ciudades,  los problemas del medio ambiente y la energía, y, en definitiva, mejorar la calidad de vida de los ciudadanos. Seguro? El almacenaje de datos es barato, el problema es mantenerlos en orden a medida que pasa el tiempo. La curación y preservación de los datos es un problema mucho más complejo que encima se vuelve más enrevesado con la llegada de Big Data (debido a la variedad, como veremos la semana próxima). Debemos entonces almacenar todo y ya nos preocuparemos de preservarlo luego? O debemos almacenar únicamente aquello potencialmente interesante y relevante?

Tercero, no deberíamos preocuparnos tanto por el Big Data. Normalmente no vamos a interaccionar directamente con “los-grandes-datos”. Creo que estoy en lo cierto en afirmar que a nadie le gusta tratar con miles de filas y columnas de datos. Lo normal será que terminemos manejando una porción reducida de éstos, tras un proceso de agregado y filtrado de los big data para extraer datos de valor y relevantes, que sí nos servirán para tomar decisiones fiables. Luego, no deberíamos sentirnos frustrados por la avalancha de nuevas herramientas Big para tratar datos Big. Si somos capaces de obtener conjuntos pequeño de datos significativos, haremos nuestros análisis correspondientes con las herramientas que ya conocemos y que tenemos a nuestro alcance.


Por muy grandes que sean los datos en cuanto a volumen, siempre querremos disponer de porciones reducidas, representativas y manejables, pero que nos permitan llegar a las mismas conclusiones que con los originales. Luego el reto en Big Data no está en el aumento del volumen de los datos, sino en su reducción adecuada

viernes, 18 de octubre de 2013

Big Data en unidades de información

Imagina un mundo en que existen conjuntos de datos descomunales que contienen datos sobre cada uno de los detalles de las publicaciones científicas, los autores, el rol de cada autor, los datos empleados en los estudios, las presentaciones públicas derivadas de cada presentación, videos, manuales y documentos asociados, información sobre los proyectos que financian dichas investigaciones, las patentes asociadas, y detalles sobre los productos o servicios transferidos al mercado derivados de la investigación, y porque no otros tantos mensajes, tuits, fotos y entradas de blogs provenientes de las redes sociales que cuentan la impresión y percepción que tienen terceros (colegas, clientes, amigos e incluso la familia) sobre el último trabajo científico.

Jim Cray lideró el cambio hacia el cuarto paradigma en la ciencia, basado íntegramente en una ciencia intensiva en datos. El término paradigma presupone un tipping point, un cambio en hacer las cosas como resultados de la acumulación de pequeños cambios a lo largo del tiempo. Tal como apuntó Kuhn en su indispensable libro The structure of scientific revolutions”, "la ciencia no progresa mediante acumulaciones lineales de nuevo conocimiento, sino que periódicamente suceden revoluciones, o cambios de paradigma, que transforman radicalmente la naturaleza del método científico en ciertas disciplinas y campos".

La ciencia intensiva en datos esta aquí y viene para quedarse. Representa el inicio hacia un cambio de paradigma que se asentara durante los próximos años. Significa una revolución necesaria para adecuarse a las nuevas condiciones del entorno: datos, datos y datos. Y por qué ahora surge esta manía colectiva por los datos si siempre hemos estados rodeados de inmensas cantidades de datos? El cumulo de varios factores puede explicar que este cambio de paradigma suceda justo ahora y no antes.

Primero, la democratización de la tecnología móvil ha propiciado que muchos ciudadanos lleven un “generador de datos en cualquier lugar y momento” en su bolsillo.

Segundo, el giro hacia el usuario, la colaboración, y la producción de contenido colaborativo de la Web 2.0 ha permite la creación masiva de datos y ha sido un factor determinante para que se precipite el cambio de paradigma.

Tercero, la tecnología necesaria para el almacenamiento, análisis y minería de grandes cantidades de datos ha alcanzo un estado de madurez aceptable para que la ciencia intensiva en datos sea posible. Aquí no me refiero a una única tecnología sino a un conjunto de tecnologías interrelaciones como la computación en la nube, virtualización, bases de datos No-SQL, nuevos modelos de computación como MapReduce, sensores, y un largo etcétera, que hacen posible en conjunto Big Data, o sea, el tratamiento masivo de datos.

Cuarto, el coste de las herramientas Big Data se ha reducido de tal forma que cualquiera puede tener acceso a ellas, y no solo un selecto club de privilegiados (CERN, Yahoo!, o Google) como era hasta ahora.

Quinto, los espabilados que ven negocio a través de los datos también han impulsado la demanda por Big Data. Lo que nos cuentan los datos puede servir para explorar nuevas tendencias de mercado, segmentación de clientes, estudiar la productividad de una comunidad científica, pronosticar intención de voto, analizar el tejido empresarial-investigación de una región e incluso diseñar nuevas políticas de futuro.


La ciencia intensiva en datos necesita de herramientas, métodos y personal con miras analíticas para explotar convenientemente Big Data. A lo largo de las próximas semanas analizaremos las Vs que caracterizan a Big Data así como su valor e impacto para las Unidades de Información 

sábado, 7 de septiembre de 2013

Big Data: The future is in analytics

Este artículo de Abril de 2013 en la revista Geospatial World comenta algunas recomendaciones  que me han llamado especialmente la atención. Primero, no caigamos en el mismo error del pesado (lease servicios OGC vs. servicios web), y pensamos que necesitamos un Geo Big Data especial para la comunidad  geoespacial diferente de la corriente  actual de desarrollo en Big Data. Nada de eso, lo que hay que intentar es revalorizar el componente geográfico en el contexto de la tecnología actual de Big Data, sin tener que crear dos mundos artificiales distintos, uno geo y otro el resto del mundo, que en la vida real están totalmente conectados desde el punto de vida del usuario. Por ejemplo, no creo que estas dos preguntas a un Big Data necesiten tecnología distintas: Dame los sensores que miden contaminación de aire o dame los sensores que miden contaminación de aire cerca de mi? Segundo, Big Data, en una simple frase,  trata del almacenamiento de grandes cantidades de datos estructurados y no estructurados, que con la tecnología actual de bases de datos no es posible. Esto ya es un reto, por supuesto. Pero mas que el almacenaje de datos, lo interesante es sacar jugo a los datos, descubrir relaciones ocultas que únicamente emergen cuando se aplican técnicas de análisis de datos. De ahí la importancia  de la parte analítica en el Big Data. Tercero y ultimo, cito textualmente al autor porque lo explica de maravilla:
GIScience needs to move away from this approach [descriptive analysis] and move on to a model-centric approach, which stresses the underlying spatial processes rather than addressing the data bottleneck. [...]. The need is for runtime stream data analysis. The focus therefore shifts from the database to a model dictionary that is applied to streaming data to detect the states of the environment to highlight normal and abnormal conditions. Stream processing can be used to tune model parameters and to store useful data samples.

viernes, 26 de julio de 2013

A vision for data science (toolkit)

Data Science (la ciencia de los datos) y Big Data son términos en boga. Muchos proyectos de investigación  se centran únicamente en la recolección de datos y su posterior almacenamiento en enormes  repositorios. Sin embargo, el verdadero valor que puede potenciar el despegue de los datos como ciencia no es su recolección tal cual sino en la disponibilidad de herramientas de análisis,  integración,  búsqueda y transformación de datos que sepan operar con grande volúmenes de datos complejos, de tipos distintos y contextos variados, como los que se encuentran en Big Data. El termino ciencia en Data Science se refiere pues a la necesidad de encontrar nuevos algoritmos de integración que sepan unir (no reescribir en otro lenguaje otra vez) piezas ya existentes, ponerlas a trabajar en arquitecturas basadas en módulos integrables y compatibles con los requisitos de Big Data, y que ademas sepan sacar el máximo jugo a esos datos. Complicado? Mejor reutilizar y convertir formatos de datos que escribir miles de algoritmos de nuevo, no? Todo esto nos lo cuenta Chris A Mattman, jefe del proyecto para iniciativas de Big Data de la NASA en el comentario de abajo.
C.A. Mattman. A vision for data science. Nature 493:473-475. doi:10.1038/493473a