Pascal Neis, Dennis Zielstra. Recent Developments and Future Trends in Volunteered Geographic Information Research: The Case of OpenStreetMap. Future Internet, 6, 76-106, 2014.
Apto para quien desee saber un poco más la historia y quehaceres de OpenStreetMap (OSM), proyecto pionero en la recolección de datos geográficos por los usuarios-productores de contenido (Voluntereed Geographic Information o VGI) .
Pero la historia y contexto es solo el principio. El núcleo del articulo se centra en un par de análisis de OSM desde dos ópticas complementarias: calidad de los datos y el perfil del usuario-productor.
En primer lugar comparan los datos OSM atendiendo a los parámetros que vienen en la norma ISO 19175 sobre calidad de datos geográficos. Los autores repasan de forma exhaustiva con numerosas referencias a la literatura relacionada, cada uno de estos parámetros de calidad, como la precisión de los datos, completud, la evaluación de puntos de interés y objectos geográficos, aspectos de geocodificación, veracidad y cobertura espacial de los datos, entre otros. Se trata de un análisis bien documentado, con gran cantidad de porcentajes que ayuda a poner en contexto la calidad de los datos OSM frente a otras fuentes de datos. Sin embargo, el texto es algo denso y manco de visualizaciones para enriquecer y fortalecer el texto puro y duro.
En segundo lugar el artículo análisis OSM desde la visión del verdadero protagonista, el usuario productor de datos geográficos. El estudio se hace echo otra vez de un hecho común en proyecto de código abierto: el número de usuarios registros dista muchísimo del numero que realmente aporta contenido. Este efecto es fiel a una distribución Long Tail. El análisis continua con aspectos socio-económicos y demográficos desgranando la distribución geográfica, por género, y motivación de los usuarios de OSM. Hombre, entre 20 y 40 año, con estudios universitarios, altruista, y que vive en Europa o Norte América es el prototipo ideal de productor de datos para OSM.
El artículo concluye resumiendo los puntos más destacables de los dos análisis anteriores sobre la calidad de los datos y el perfil de usuario en OSM. Otra revisión del estado del arte sin futuro.
Un artículo es únicamente la punta del iceberg de una investigación. Unos cuantos folios no son suficientes si que quiere ir más allá de su lectura.
Algunas revistas como GigaScience ya enlazan el artículo científico a un repositorio de datos (GigaDB Dataset) que aloja los recursos relacionados al propio artículo, ya sean datos, scripts, o documentación adicional. Todo el conjunto de recursos queda identificado con un DOI, que habitualmente se incluye como una referencia más del propio artículo científico.
En Mayo 2014 se lanza la revista Scientific Data,
cuyos artículos serán descripciones de datos junto con un enlace a los propios datos alojados en repositorios públicos como biosharing.
Scientific Data is a new open-access, online-only publication for descriptions of scientifically valuable datasets. Scientific Data exists to help you publish, discover and reuse research data.
Esta tendencia parece que coge forma: hacer públicamente accesible y citable cualquier recurso (artículo, datos, software) relacionado con una investigación para otros puedan beneficiarse y asegurar al mismo tiempo su validez científica. La fusión de revistas y repositorios podría ser el siguiente paso. La idea de centralizar artículos por disciplinas y sus datos asociados en un mismo sitio web permitiría tener, hasta cierto punto, controlado el conocimiento generado sobre una misma disciplina.
Dejando a parte los pros y contras de un hipotético mega-journal-repositorio, si verdaderamente existiera, podría ofrecer servicios que a día de hoy todavía no existen. Por ejemplo: revisiones del estado del arte dinámicas.
Como cualquier investigador, últimamente me he visto inmerso en trabajos de este estilo. Como ejemplo, la última revisión publicada en Computers, Environment and Urban Systems. Mi problema de fondo creo que generalizable a otros investigadores: Ni he podido beneficiarme de los datos de análisis de revisiones anteriores ni otros colegas podrá hacerlo en el futuro con mi revisión. Si hubiera tenido acceso por ejemplo a las tablas utilizadas durante el análisis de la revisión, justo con los criterios de comparación (columnas) para cada uno de los artículos revisados (filas), seguramente me hubiera ahorrado tiempo, duplicación de esfuerzos, y el trabajo de revisión colaborativo final hubiera sido mucho de mayor calidad y precisión. Como decía, hay tareas para las cuales se necesita mucha más información que la que viene en el artículo publicado.
¿Sería posible un sistema que mantuviera el estado del arte de una disciplina continuamente actualizado? Y no me refiero únicamente a la lista de artículos, sino a los datos utilizados para compararlos, los criterios utilizados, las gráficas estadísticas de resultados, las tablas sumarios, etc. Imagínate: un sistema que fuera capaz de añadir cada artículo nuevo relevante para el estado del arte de una disciplina como una fila más a su base de datos, que extrajera los datos relevantes para el análisis, determinara los valores de la comparación, y visualizar los resultados al instante.
El resultado: un conjunto de datos vivo, referenciable, público, colaborativo y accesible a toda la comunidad investigadora. Dejaría de ser un trabajo de revisión del estado del arte de una disciplina para convertirse en una herramienta de visión de tendencias de una disciplina.
Tras el Volumen y la Variedad, seguimos con la serie de las Vs que caracterizan a Big Data para las Unidades de Información con la V de Velocidad.
La velocidad con la que se producen datos es otra característica de Big Data que promete, si no lo es ya, en convertirse en reto. Uno de los grandes problemas derivado de tener grandes cantidad de datos, de diversa índole y producidos continuamente, es la escasa capacidad de análisis. Algunos comentarios ya han hecho notar el notable diferencial entre la cantidad de datos que somos capaces de almacenar, con respecto a la cantidad de estos (mucho menor) que somos capaces de analizar. Esto se traduce en que muchos datos de entrada no pueden ser analizados y por lo tanto no se les puede extraer valor (próxima V de la serie). Valor desde mi punto de vista es la auténtica V de Big Data. Unido a esto, la tendencia es que esta diferencia entre datos recogidos y analizados se incremente con el tiempo, luego el problema, lejos de solucionarse en el corto tiempo, va a ir a más.
Se me ocurren un par de estrategias simples para intentar abordar el problema anterior.
La primera consistiría en reducir la cantidad de datos de entrada, para que la cantidad de datos que se va analizar se adecue a la capacidad real de análisis. ¿Tiene sentido que las bibliotecas almacenen todo el flujo de datos que les llega? ¿Cada uno de los resultados de investigación? ¿O se deberían aplicar filtros de calidad y forzar la colección de resultados de investigación agregados, procesados en vez resultados en bruto, para restringir así el volumen de entrada de datos? ¿Facilitaría lo anterior tareas posteriores de análisis, búsqueda y preservación?
La segunda es poner hincapié en aumentar la capacidad de análisis. A primera vista parece un aspecto únicamente tecnológico: mejorar capacidad de cálculo, algoritmos avanzados, etc. Pero creo que la capacidad de análisis en Big Data, entendido como el medio para encontrar valor y conocimiento de los datos de entrada, tiene un componente humano vital . Los bibliotecas no parece que se están preparando, tanto a nivel tecnológico como humano, para afrontar este nuevo contexto de Big Data.
Las tres Vs -Volumen, Variedad y Velocidad-, que para muchos definen Big Data, rascan muy ligeramente el verdadero potencial del Big Data, ya que están más cerca del dato que de la promesa del conocimiento que esperamos obtener con Big Data. En una próxima entrega nos meteremos de lleno con la Validez y el Valor, las Vs que se aproximan cada vez al verdadero propósito del Big Data: generar conocimiento a partir de datos.
Algunos proyectos para no perder de vista (algunos ya terminados, otros arrancando) sobre compartición y análisis de datos abiertos (linked data, big data, research data), con especial mimo a la parte geo-espacial, con el objetivo de sacar el máximo rendimiento a los datos:
- PlanetData, Large-scale Data Management (10/2010-09/2014), es una red de excelencia dividido en subproyectos como por ejemplo Linked Map, que busca desarrollar una extensión de la especificación WMS de OGC para que incorpore Datos Enlazados a la propia visualización de los mapas.
- OpenCube, Publishing and Enriching Linked Open Statistical Data for the Development of Data Analytics and Enhanced Visualization Services (11/2013-10/2015), desarrollará herramientas para publicar datos estadísticos enlazados y para analizarlos y visualizarlos .
- PHEME, Computing Veracity - the Fourth Challenge of Big Data (01/2014-12/2016), desarrollará herramientas para identificar y validar información relevante de grandes repositorios de datos.
- MELODIES, Maximizing the Exploiting of Linked Open Data for Enterprise and Science (10/2013-11/2016), desarrollará servicios para el medioambiente a partir de datos abierto y enlazados.
- CHAIN-REDS, Co-ordination and Harmonization of Advanced e-Infrastructures for Research and Education Data Sharing, se centra en promover la colaboración entre científicos facilitando la interoperabilidad de infraestructuras de datos temáticas.
- ENGAGE, An infrastructure for Open, Linked Governmental Data Provision towards Research Communities and Citizens, busca hacer disponibles datos del sector público a los ciudadanos y a la comunidad investigadora.
- SmartOpenData, Linked Open Data for environment protection in Smart Regions, enlazará datos medioambientales, de investigación y VGI, teniendo en cuenta políticas y directivas de datos medioambientales.
Últimamente me veo enredada laboralmente en temas sobre la preservación de la memoria y cómo esto se ve afectado por lo digital. Sabéis que es difícil separar lo que hacemos en el trabajo de nuestras vivencias mas personales, sobre todo si te gusta lo que haces...
Haciendo "vigilancia" sobre estas temáticas llegue a este post sobre la preservación de la memoria familiar y qué legado vamos a dejar a nuestras familias, ahora que casi todo es digital. Dejando a parte, todo el tema de las claves, contraseñas y toda la huella digital que vamos dejando por la Red, el right-to-be-fogotten o forbidden o right-to-erasure (podéis ver un conjunto de noticias del tema en The Guardian) me interesa particularmente el tema de la información que nos atañe de forma mas personal. Os pongo un ejemplo:
¿Estáis haciendo algo para tener, más o menos controladas las fotos que hacéis? ¿Las tenéis en múltiples dispositivos (tablet, movil, camara, cloud, PC...) o las centralizáis en algun sitio? Si es así, ¿dónde, en vuestro PC, en la nube, en un USB? Y, ¿os fiáis de que van a estar accesibles en el futuro? Habéis pensado si los formatos pueden evolucionar de tal forma que cuando queráis ver esas fotos en cinco o diez años ya no sean "entendibles" y no las podáis ver? Y, ¿si se rompe el ordenador, se pierde el USB, o la empresa que nos da servicio de cloud quiebra? Y es necesario que conservemos todas las fotos que hemos hecho o solo una selección de ellas? Y ¿cómo te organizas con todas las fotos? ¿las metadatas?
Lo mismo me pasa con el blog, ¿que será de él en el futuro? ¿Es una cosa que vale la pena conservar? ¿De qué forma? ¿Y si blogger desaparece y mi blog se va con él (tal y como paso con Geocities)?
Hay informaciones en la Red de las que determinadas instituciones se están haciendo cargo, por la carga histórica que estas puedan tener, ardua y difícil tarea. Pero, ¿qué pasa cuando son nuestros propios recuerdos los que están en juego? Creo que muchos no habíamos pensado en esto, al menos detenidamente y si queremos dejar algún legado debemos tomar conciencia sobre estas cosas, e intentar ponerle remedio. Al menos intentarlo.
Yo, personalmente, estoy sufriendo una vuelta a la caja de zapatos (donde guardábamos los recuerdos familiares o de infancia). Primero estoy dando una mínima estructura organizativa a las fotos (por años, carpetas) a modo de (pseudo)metadatos, y las estoy copiando por partida doble: en un USB gordo-gordo y en la nube. También he decidido imprimir algunas de las fotos (una selección de ellas porque he guardado tantas mías y de amigos que sería una fortuna imprimirlas todas), y hacer un album digital cada año e imprimirlo. También me he puesto manos a la obra con el blog usando alguna de las herramientas que hay por ahí como Blogbooker o Blurb, que te generan un pdf con las páginas del blog a modo de libro, que quizá también imprima en el futuro.
Luego, ¿pensáis que esta estrategia de alejamiento del papel y vuelta a el, podría ser una solución "fiable" para conservar nuestra memoria familiar?
Daniel Sui (2014). Opportunities and Impediments for Open GIS. Transactions in GIS, 18(1):1-14
Excelente artículo, de esos que vale la pena leer con detenimiento y analizar todo lo que una experimentada y fluida pluma nos cuenta sobre oportunidades y barreras que pueden afectar al despegue de SIG como disciplina científica en auge en el futuro.
En este artículo, versión extendida de una AAG 2013 Plenary Keynote del mismo autor, Sui destaca la idea de Open GIS, reflejo de las iniciativas Open X (Open Science, Open Source, Open Government, Open Data, etc.), la cual intenta reflejar la cultura Open en el contexto de SIG atendiendo a las siguientes dimensiones: datos, software, hardware, estándares, publicaciones, investigación, financiación y educación. Y todo ello, claro, con el Open delante.
El objetivo primordial es concienciar a la comunidad SIG de que no se centre únicamente en los datos y software sino que las otras dimensiones son igualmente importantes para potenciar el valor de SIG como disciplina abierta en el contexto actual de cultura y movimiento abierto en el que nos encontramos.
En la primera parte del artículo, el autor desgrana cada una de estas dimensiones abiertas en el contexto de Open GIS.
No es nada nuevo que la comunidad SIG haya sido pionera en las dimensiones de datos (INSPIRE, IDEs, etc.), software (dar un vistazo a la serie de conferencias FOSS4G) y estándares abiertos (e.g. OGC). Pero de los éxitos pasados no se vive eternamente, y hay que seguir involucrándose en los nuevos avances y tendencias en cuanto a datos (p.e. open data, big data), software (p.e., IoT, smart cities, smartphones) y estándares (p.e. sinergias con estándares de otros dominios como salud). Este es justo el caso del hardware abierto: el bricolaje gana adeptos espectacularmente debido a la facilidad de reutilizar y combinar componente físicos (arduino, raspberry pi), como si fueran piezas de Lego, para luego enganchar el sensor o sensores resultantes con dispositivos móviles. El cóctel de sensores (hardware abierto) + procesamiento móvil (software abierto) + mediciones del entorno en cualquier lugar (datos abiertos) abre nuevas oportunidades para la comunidad SIG.
Las otras cuatro dimensiones abiertas - publicaciones, investigación, financiación y educación - son relativamente nuevos nichos desde la perspectiva SIG. Con respecto a la primera, el autor incide en la oferta creciente de revistas de acceso abierto en el campo de SIG. Ciertamente me hubiera inclinado por otros aspectos. La investigación abierta no es algo propio de Open GIS, sino de cualquier disciplina científica. La colaboración entre científicos y la transparencia del método científico para facilitar la reutilización y reproducción de los resultados científicos son pilares fundamentales de la ciencia. En el caso de la financiación abierta, se identifica el caso de plataformas crowdfunding como mecanismo de financiación alternativo (a la administración pública) de proyectos SIG, aunque aún muy incipiente y sin experiencias claras que tomar de referencia. Finalmente, con respecto a la educación abierta, el autor comenta muy por encima el potencial todavía por desvelar de los cursos MOOCs en temáticas geo-espaciales.
En la segunda parte del artículo, el autor se moja (es su deber, puesto que es un pope) y propone futuras lineas de investigación (oportunidades) para Open GIS, así como barreras (impedimentos) que pueden dificultar las primeras.
Oportunidades:
- Spatial big data deluge: Nuevas herramientas y técnicas para procesamiento geo-espacial y asegurar la calidad de datos en big data.
- New applications for improving individual and collective decisions: Nuevas aplicaciones que exploten los datos de localización para la toma de decisiones a nivel personal pero también de forma colectiva, dando importancia al espacio y lugar para situaciones complejas como por ejemplo en la vigilancia territorial o en la definición y evaluación de políticas.
- Open geographic (citizen) science for understanding the chaning planet: La curiosidad científica de los ciudadanos será crucial para involucrarlo en proyectos científicos y mejorar así nuestra comprensión de problemas con una clara dimensión geo-espacial (medioambiente, movilidad, etc.).
- Vision for a spatial university: Inculcar un pensamiento espacial y crítico en la próxima generación es clave por la horizontalidad de SIG y del concepto de espacio en ciencias, ingenierías, tecnologías, salud y ciencias sociales.
Impedimentos:
- The academic culture and the reward system: la cultura de todo abierto aun no casa muy bien con las actuales medidas de evaluación, obsoletas y conservativas, en las universidades, especialmente por la falta de conexión entre contribución y atribución.
- Existing laws and intellectual property rights: IPR, copyright y atribución son clave para establecer un marco legal adecuado para el desarrollo de la cultura abierta.
- Social/political barriers and the chaingign power relationships: Unas pocas empresas privadas acumulan ya más datos de los ciudadanos que la propia administración pública, debido al uso de aplicaciones sociales "gratis" , que son una puerta abierta sin control a nuestros datos personales.
- Environmental impacts and sustainabilty goals: Aún está por ver el impacto medioambiental de la propia cultura abierta, de la cual Open GIS forma parte.
El autor concluye evitando los extremos (todo open, todo closed) y toma una posición híbrida que, en mi opinión, es bastante lógica y realista:
I am a strong advocate for open science in general and open GIS in particular, but I do not believe that the free and open paradigm will be a panacea for all the problems and challenges we are facing in our profession.
Por último, la sección de referencias es sensacional.
Hemos pensado en comenzar a partir de Enero 2014 dos tipos de entradas nuevas bien definidas en cuanto a objetivo y que tengan continuidad semanal, al menos cada viernes, para cerrar la semana.
#summario: Recopila enlaces de cualquier índole (paginas web, proyectos, herramientas, noticias, etc.) que nos han llamado la atención especialmente durante la semana. Como ejemplo, el primer #sumario
#destacables: Recopila literatura anotada especialmente relevante para nosotros
Espero que os sirva. A nosotros seguro!