Affichage des articles dont le libellé est NoSQL. Afficher tous les articles
Affichage des articles dont le libellé est NoSQL. Afficher tous les articles

mardi 12 juillet 2016

Tech use case Neo4j

     Tout d'abord une petite introduction car cela fait un petit moment que je n'ai pas pris ma plume numérique pour gratter quelques mots sur ce blog .... le grand problème des temps modernes : le temps.

     Du coup ce retour n'est pas pour un long article mais pour y inscrire quelques références et laisser une trace dans le temps d'une utilisation qui me semble intéressante de Neo4j (oui oui, toujours java, jvm, datastorage, ... cela n'a pas changé). Ce qui me permettra d'y revenir pour creuser plus en avant ces pistes si l'occasion se présente.

Neo4j pour une utilisation côté développeur

     C'est parti d'une réflexion simple lors d'une soirée discussion développeur : quand je veux analyser mon heap java, c'est un graph d'objet (avec ses dominators, ....).

     Pour avancer en runtime des profiler proposent des vues sur le contenu, en statique via heapdump une photo qui peut être analysée (jdk tool, MAT, ...). Soit mais la console Neo4j est quand même bien jolie et Cypher plutôt sympa comme langage à utiliser, du coup je me dis qu'il y a bien quelqu'un qui a travaillé sur le sujet.

Différente utilisation en analyse de code, repo maven, ... :
http://neo4j-contrib.github.io/asciidoc-slides/content/presentation/software_analytics/software_analytics.html

Analyser un java heap avec Neo4J
https://www.infoq.com/presentations/neo4j-java-heap-analysis
https://speakerdeck.com/npryce/looking-for-smoking-guns-in-a-haystack-jvm-heap-analysis-with-neo4j

En complément :
Génération d'un heapdump en programmatique
https://github.com/neo4j/neo4j/tree/6280974efc9b082d5f40044df362355134a8632b/community/kernel/src/test/java/org/neo4j/test/rule/dump
https://searchcode.com/codesearch/view/71592610/

Quand on ne le fait pas en Cypher, on peut le faire en OQL (Object Query Language)
https://visualvm.java.net/oqlhelp.html

Un HPROF c'est écrit comment
https://blogs.oracle.com/kto/entry/the_hprof_manual
https://blogs.oracle.com/kto/resource/manual.html
https://java.net/downloads/heap-snapshot/hprof-binary-format.html

Projet de parsing d'HPROF
https://github.com/eaftan/hprof-parser

Voilà, voilà avec tout cela on doit pouvoir générer un heapdump, le parser, insérer le graph dans Neo4j afin qu'il soit à disposition pour être requêter en Cypher ... ya plus qu'à .... avec un peu de temps.

2e cas qui peut être sympa, parsing du code (antlr, ...) et représentation des dépendances en vision statique code écris.

Et en dehors de Neo4j

Une histoire des datastorage du file system au NoSQL
https://published-rs.lanyonevents.com/published/oracleus2015/sessionsFiles/3659/CON7557_Remani-bigdata-javaone.pdf

Comparatif des solutions de streaming
http://fr.slideshare.net/GyulaFra/largescale-stream-processing-in-the-hadoop-ecosystem-hadoop-summit-2016-60887821

Perspective ecosystem Hadoop et une photo du premier Hadoop, l'éléphant peluche
http://fr.slideshare.net/cloudera/apache-hadoop-at-10-59397028




dimanche 29 mars 2015

Quelques pointeurs NoSQL

Post rapide pour présenter quelques urls

Liste assez complète de base NoSQL et plus
http://nosql-database.org/

Ce site en lien avec les  NoSql matters, conférences dédiées au NoSQL dont une s'est déroulé le 26 et 27 mars dernier à Paris, pour vous faire une idée du programme

Une série d'article sur le NoSQL : de l'histoire à quels critères de sélection :

Pour finir un blog très bien fait avec un article présentant les familles NoSQL
https://highlyscalable.wordpress.com/2012/03/01/nosql-data-modeling-techniques/

NoSQL ok, mais OLAP ?


     Le NoSQL a le vent en poupe. Les bases de ces frameworks développés au début des années 2000 (2000, 2010) par les géants du web (Google, Facebook, Amazon, ...) pour répondre à leurs besoins croissants de gestion de volume de données en constante augmentation avec des temps de réponse de l'ordre de l'instantané tout en assurant la disponibilité via redondance de l'information.

     L'idée était de disposer de datastorages réactifs en abandonnant un certain nombre de contraintes (voir CAP théorème, encore appelé théorème de Brewer), ce que ne permettaient pas les bases de données classiques (Oracle, Sysbase and Co)

     Aujourd'hui ces frameworks ou leurs principes sont repris par les communautés de développeurs et font régulièrement l'objet de présentations, article blog, ...

     Au milieu de tout ce mouvement NoSQL, un autre principe qui fait moins l'actualité mais reste très présent dans la catégorie datastorage : OLAP.

     Oracle, SAP, Microsoft, ... ont dans leurs gammes de produits entreprise tous une brique OLAP, restant un produit. Les communautés de développeurs ne se sont pas encore emparé du sujet mais on l’aperçoit de temps en temps.

OLAP c'est quoi


     L'acronyme OLAP signifie OnLine Analytical Processing.

     On le défini souvent par opposition à l'OLTP (Online Transaction Processing). Il se veut un outil permettant facilement d'analyser un important volume de données. Cela tombe bien on est en période BigData.

Définition wikipédia :

     La encore ce n'est pas quelque chose de récent, si l'on creuse un peu l'histoire on tombera sur Edgar F. Codd et les 12 règles de Codd (1993) :

     Puis un langage de Microsoft en 1997 le MultiDimensional eXpressions permettant de requeter un produit OLAP, c'est devenu un standard dans le monde OLAP.

Olap et le monde Java


     Il y a eu un premier essai qui n'a pas abouti qui s'est traduit par une JSR commencé en 2000 et abandonnée officiellement en 2012 n'ayant pas évolué depuis 2004 : JOLAP, JSR 69
https://jcp.org/en/jsr/detail?id=69

     Quelques uns ont persisté et Java possède une librairie (toujours active) de querying : Olap4j

     En lien avec le projet open source Mondrian qui lui propose la partie serveur OLAP

Olap dans la tendance actuelle


     Même si on le rencontre peu, un des intérêts d'Olap arrive là où les framework NoSQL ont quelques manques : l'aspect agrégation des données et représentation permettant d'en tirer du sens (le fameux analytics).Une combinaison que l'on peut imaginer est un datastorage massif avec redondance en NoSQL sur lequel s'appuie un frontal intermédiaire type Olap.

Deux projets adoptant cette approche :

EBay avec Kylin (Olap) s'appuyant sur du Haddop :

Un projet GitHub Doradus appuyant une couche Olap sur une couche Cassandra :
https://github.com/dell-oss/Doradus/wiki/Architecture%20%28OLAP%29

     Adobe s'est également intéressé au Olap en s'appuyant sur du HBase (datastorage derrière Hadoop)

dimanche 2 novembre 2014

Un jour, un storage : Redis

     Une autre structure de stockage de données in memory dont on entend régulièrement parler : Redis.

     Je l'ai rencontré lors d'une conférence au Devoxx Paris 2014 suite à une présentation "Tools in action" de Nicolas Martignole "Redis, une base Not Only NoSQL" :

Redis c'est quoi


     Redis signifie "REmote DIctionary Server" avec un jeu de mot sur Redistribute (http://redis.io/topics/faq)

     Si l'on retient les classifications actuelles, on pourrait la qualifier de base NoSQL clé/valeur. C'est une base in memory qui communique en TCP. Elle est écrite en C ANSI et tourne sur la majeur partie des systèmes dit POSIX, Linux est recommandé (http://redis.io/topics/introduction) mais il existe un portage windows https://github.com/MSOpenTech/redis.

     Afin de pouvoir requêter cette base de nombreux de clients ont été développés dans différents langages (Java, C, C#, Go Perl, Haskell, Lua, ...).
     Les principaux clients Java :

     Redis, construit sur la base d'un manifeste, lettre d'intention sur ce qu'il doit être, a une approche qui colle aux structures de données manipulées. Pour preuve son API et la documentation qui donne le Time Complexity (en notation O) des différents points d'API :

     Quand aux utilisations possibles : cache dynamique, base in memory (persistence possible en dump ou journalisation), messaging. Attention à vos contraintes et au CAP théorème.

L'historique


     Redis a été créé par Salvatore Sanfilippo et Pieter Noordhuis en 2009 (voir http://redis.io/topics/license).

     Avant Mai 2013 le projet était sponsorisé par VMWare, il l'est maintenant par Pivotal.

     La version actuelle est la 2.8.17, une version 3.0.0 est en release candidate. L'historique des versions depuis 2009 est accessible via Google Code

Redis est utilisé par quelques grands noms du web :

Et la concurrence ... Redis est régulièrement comparé à memcached

Les URLS


Le Site : http://redis.io/
Sous GitHub : https://github.com/antirez/redis
Les download : http://redis.io/download
Benchmarks : http://redis.io/topics/benchmarks

Du côté des développeurs :

Participer aux développements


Pour contribuer à Redis : http://redis.io/community
La mailing : https://groups.google.com/forum/#!forum/redis-db

Pour finir quelques tutoriaux pour s'y essayer :

dimanche 5 octobre 2014

Un jour, un storage : Cassandra

     L'objet de ces billets "un jour, un storage" est de parcourir les différentes structures de stockage de données qui fleurissent ces derniers temps (NoSQL ou pas).

     La plus part ne sont pas forcément jeunes et ont des ancêtres qui remontent à bien plus longtemps encore mais les besoins de technologies face aux flux de données actuels, les tendances buzz ("big data") aidant ont les croise de plus en plus régulièrement.

     Je ne vais pas détailler leurs architectures, fonctionnement, utilisation ... mais plutot donner quelques points d'entré qui permettront d'avoir un aperçu et pour ceux qui le souhaitent creuser plus en avant la technologie.

     Première structure de cette série : Cassandra

Cassandra c'est quoi


     C'est un système de stockage de donnée distribué open source. Il adresse les problématiques de scalabilité, destiné à gérer des volumes important de donnés en gardant de bonnes performances et en étant tolérant aux pannes.

     Cassandra est développé en java, considéré comme hybride dans les familles NoSQL : entre clé/valeur et orienté colonnes.

Architecture interne :

Introduction Cassandra :

Quelques tutoriaux :

L'historique


     Comme on le disait tout à l'heure même si ces projets semblent récent, ils ont démarré il y a quelques temps déjà. Quelques dates concernant Cassandra.

     A l'origine Cassandra est un projet réalisé sur un modèle open source par deux développeurs de FaceBook (Avinash Lakshman et Prashant Malik), mis à disposition en juillet 2008 sous google code.

Quelques présentations aux débuts de Cassandra :

     En Mars 2009 Cassandra rejoint Apache Incubator

     Puis Mars 2010 il devient Apache Top Level Project

     Depuis les développements continuent sous l'aile de la fondation Apache :
  • octobre 2011 la version 1.0
  • Septembre 2013 la version 2.0

     Dernière version stable : 2.1.0 (releasé en septembre 2014)

     Les branches encore accessibles :
  • 2.0.10 (aout 2014)
  • 1.2.19 (septembre 2014)

La liste des commiters participants aux développements : http://wiki.apache.org/cassandra/Committers

Les URLS


Le projet : http://cassandra.apache.org/
Download : http://cassandra.apache.org/download/
Wiki du projet : http://wiki.apache.org/cassandra/
Wikipedia : http://en.wikipedia.org/wiki/Apache_Cassandra

DataStax Société commerciale avec expertise Cassandra : http://www.datastax.com/
Communauté Cassandra/Datastax : http://planetcassandra.org/

Un meetup Cassandra sur Paris : http://www.meetup.com/Cassandra-Paris-Meetup/

Participer aux développements


Comment contribuer : http://wiki.apache.org/cassandra/HowToContribute

Les mailing :
User : user-subscribe@cassandra.apache.org
Developer : dev-subscribe@cassandra.apache.org
Notifications de Commits : commits-subscribe@cassandra.apache.org
API cliente : client-dev-subscribe@cassandra.apache.org

Le JIRA Cassandra
https://issues.apache.org/jira/browse/CASSANDRA/?selectedTab=com.atlassian.jira.jira-projects-plugin:summary-panel

Repo Git : https://git-wip-us.apache.org/repos/asf?p=cassandra.git
Règle de coding : http://wiki.apache.org/cassandra/CodeStyle