Articles

Comment installer Apache Impala sur Archlinux

Image
Une liste de pages prometteuses nécessitant des approfondissements ci-dessous. Je n'ai pas trouvé de processus sur Archlinux pour le moment. Impala Installation in Ubuntu . Download Install Impala .  Avec une Cloudera Quickstart VM , contenant déjà IMPALA, pour les plus pressés voulant rapidement expérimenter avec des requêtes SQL, il est facile de se connecter avec un pilote JDBC approprié dans Dbeaver jdbc:impala://192.168.0.11:21050/. Il faut bien entendu télécharger le bon driver chez Cloudera. Le login/pass est cloudera/cloudera. Ne pas oublier de paramétrer la connexion SSH. Cette solution est hébergée dans une VM virtualbox, paramétrée en pont réseau avec pour adresse DHCP 192.168.0.11. On pourra aussi faire du shell directement sur la distribution CentOS de la solution, dans un terminal, avec : [cloudera@quickstart ~] $ impala-shell Une page complète ici donnant tous les détails.

Installation d'Archlinux 2/2 - La voie manuelle

Image
Plutôt que de réinventer la roue une 66e fois, je vais plutôt vous diriger vers des pages utiles, qu'il vous faudra exploiter au fil des mises à jours qui pourront avoir lieu. Un excellent blog à consulter car beaucoup d'informations intéressantes. Je vous redirige vers un post de ce blog qui vous donnera les clefs pour une installation manuelle d'Archlinux avec un maximum de détails. http://frederic.bezies.free.fr/blog/?p=18771 L'iSO d'installation est accessible Archlinux download . Petit guide d’installation d’Archlinux avec Gnome 3.32.x / Plasma 5.15.x / Xfce / Mate-Desktop / Deepin / Cinnamon   (framagit) mars 2019 Petit guide d’installation d’Archlinux avec Gnome 3.32.x / Plasma 5.15.x / Xfce / Mate-Desktop / Deepin / Cinnamon (github) mars 2019 Installons Archlinux à la mimine, partie 1 : l'installation en BIOS , en vidéo 2018 Tutoriel d'installation de Arch Linux , en vidéo 2017 D'autres liens intéressants ; Tuto Archiso , pour ...

Algorythme de pondération TF-IDF en PHP pour MapReduce

Image
Voir wikipedia TF-IDF pour la définition. Dans cette activité, nous devons appliquer MapReduce à l'algorithme au coeur des moteurs de recherche du web : Le schéma de pondération TF-IDF pour calculer la pertinence d'un document par rapport à un terme d'un dictionnaire donné. Vous pourrez trouver plus de détail de cette activité sur Openclass room . Formule : w_t,d = (tf_t,d / n_d) × log(N/df_t)   avec : tf_t,d  qui représente la fréquence d'un mot  t  dans un document  d . n_d  qui représente le nombre de mots dans un document  d  (on pourra l'appeler WordPerDoc). df_t  qui représente la fréquence du terme dans la collection, soit le nombre de documents dans lequel le mot  t  est présent (dans notre cas, ce sera 1 ou 2). Enfin  N  est le nombre de documents dans notre collection, soit ici 2. Sources : Une collection de 2 documents textuels à récupérer sur le site  textfiles . Filtrage des m...

Installation d'Archlinux 1/2 - La voie facile

Image
Archlinux est une distribution Linux développée de façon indépendante, optimisée x86_64, et destinée aux utilisateurs Linux avertis. Elle utilise 'pacman', son gestionnaire de paquets fait-maison, pour fournir des mises à jour des dernières applications avec une complète gestion des dépendances. Utilisant un système de publication continue (rolling release), Arch peut être installée à partir d'un CD ou via un serveur FTP ou une simple clef USB. L'installation par défaut fournit une base solide qui permet aux utilisateurs de créer leur propre installation personnalisée. De plus, le Arch Build System (ABS) fournit un moyen d'installer facilement de nouveaux paquets, de modifier la configuration des paquets standards, ou de partager ces paquets avec d'autres utilisateurs via le Arch User Repository (AUR). Arch est très respecté pour l'énorme quantité de documentation communautaire qu'il a publiée ces dernières années - les utilisateurs de ...

Installation de HBASE Zookeeper sur Archlinux

Image
Si vous avez suivi et réussi les tutoriels précédants, HADOOP et HIVE , nul doute que vous trouverez celui-ci plus sympa, car plus court. HBase, encore une autre base de données sur HDFS. Quelle est donc sa particularité ? Elle profite tout simplement d'une architecture en colonne, tout comme une architecture horizontale. Elle s'étend d'elle-même en profitant du vaste espace offert et géré par HDFS. Du coup, pas de verticalité. L'accès aux données se fait par bloc de famille, matérialisé par des paires clef/valeur datées. HBASE n'est pas seul, car il s'appuie sur ZOOKEEPER, créé pour maintenir la coordination et la synchronisation au sein d’un cluster Hadoop. Nous allons donc voir l'installation et la configuration de ces deux services, dans l'espace de l'utilisateur hadoop déjà ouvert et configuré. HBASE a besoin du langage ruby pour fonctionner en shell, de fait il nous faudra d'abord installer ce composant sur notre architecture ...

Installation de HIVE sur Archlinux

Image
Nous avons vu dans un précédent article l' installation de HADOOP sur une architecture ARCH. Pour aller plus loin et profiter du système MapReduce, intéressons-nous à HIVE, une base de données schemaless s'appuyant sur MapReduce pour échanger des données sur HDFS, profitant ainsi des données distribuées sur clusters et de la tolérence de panne en découlant. Nous resterons sur l'architecture ARCH, solide, pour déployer HIVE. Nous utiliserons une version stable en accord avec HADOOP, la version 2.3.4. Il est très déconseillé de s'aventurer pour l'instant dans des versions supérieures (V3), car buggées et pas assez éprouvées. A ce stade, Archlinux a été pleinement configuré, à savoir ; l'utilisateur hadoop a été créé le fichier hosts a été configuré proprement ssh a été installé et configuré le jdk java a été installé dans sa version 1.8 les outils additionnels ont été installés HDFS est accessible en lecture et en écriture Si ce n'est forcément...