Cours
Les créateurs de Homebrew le présentent comme le « gestionnaire de paquets manquant pour macOS ». Les paquets sont des ensembles de fichiers groupés pouvant être installés et supprimés en bloc. Un gestionnaire de paquets automatise l’installation, la mise à jour et la suppression de ces paquets.
Si vous êtes utilisateur ou utilisatrice de Python, vous avez peut-être déjà utilisé le gestionnaire de paquets pip ou les fonctionnalités de gestion de paquets de conda pour installer, mettre à jour ou supprimer des bibliothèques.
Si vous êtes utilisateur ou utilisatrice de R, vous avez sans doute utilisé le RStudio Package Manager pour installer, mettre à jour ou supprimer des packages.
Homebrew est un gestionnaire de paquets conçu pour Mac, très utile à avoir sous la main. Vous verrez que vous pouvez l’exploiter en data science, car il facilite grandement l’installation de technologies complémentaires sur Mac comme Apache Spark et le logiciel Graphviz.
Sur ce, commençons.
Installer les Command Line Tools
Pour installer Homebrew, vous devez installer soit les Xcode Command Line Tools (environ 100 Mo), soit le package Xcode complet (environ 10 Go). Dans ce tutoriel, vous allez installer les Command Line Tools, d’une taille plus raisonnable. Les Command Line Tools fournissent aux utilisateurs Mac de nombreux outils, utilitaires et compilateurs courants. Un avantage important : leur installation ajoute Git, dont vous avez besoin, car Homebrew repose essentiellement sur des scripts Git et Ruby.
1. Ouvrez un nouveau terminal. Pour cela, cliquez sur la loupe Spotlight en haut à droite de l’écran, tapez terminal puis cliquez sur l’icône Terminal. Vous pouvez vérifier si Command Line Tools ou Xcode est installé en tapant la commande ci-dessous dans votre terminal.
xcode-select -p

Si vous voyez s’afficher un chemin comme dans l’image ci-dessus, passez directement à la section « Installer Homebrew » du tutoriel. Vous avez déjà Xcode ou les Xcode Command Line Tools d’installés.
Si rien ne s’affiche, poursuivez avec l’étape 3.
2. Tapez la commande suivante dans votre terminal pour installer les Command Line Tools. Si une fenêtre semblable à celle de l’image ci-dessous apparaît, cliquez sur Installer.
xcode-select --install

Si un contrat de licence s’affiche, lisez-le puis cliquez sur Accepter.
3. Vérifiez de nouveau si les Xcode Command Line Tools sont installés. Ouvrez un nouveau terminal et tapez la commande ci-dessous.
xcode-select -p

Installer Homebrew
Ouvrez un terminal et tapez la commande ci-dessous. Il vous sera demandé votre mot de passe, généralement le même que celui utilisé pour déverrouiller votre Mac au démarrage. Après saisie, l’installation commencera.
/usr/bin/ruby -e "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/master/install)"

Commandes Homebrew
Voyons maintenant les commandes Homebrew les plus courantes.
Installer un paquet
La commande ci-dessous installe le paquet wget. Remplacez wget par le paquet que vous souhaitez installer.
brew install wget
Désinstaller un paquet
La commande ci-dessous désinstalle le paquet wget. Remplacez wget par le paquet que vous souhaitez supprimer.
brew rm wget
Lister les paquets installables
brew search répertorie tous les paquets que vous pouvez installer. L’image ci-dessous montre la sortie de brew search.

Un usage plus pratique de brew search consiste à affiner la requête. Par exemple, si vous souhaitez installer Apache Spark, utilisez la commande ci-dessous pour vérifier l’existence d’un paquet Apache Spark à installer.
brew search spark

D’après l’image ci-dessus, il existe un paquet Apache Spark potentiel nommé apache-spark qui pourrait être utile à installer. Il peut être judicieux d’obtenir plus d’informations sur apache-spark : c’est justement l’objet de la commande brew info.
Obtenir des informations sur un paquet
La commande brew info est très utile pour en savoir plus sur un paquet et connaître ses prérequis.
La commande ci-dessous fournit plus d’informations sur le paquet apache-spark.
brew info apache-spark

Vous remarquerez que la sortie indique que ce paquet nécessite Java version 1.8 et fournit quelques liens pour en savoir plus. La section suivante détaille l’installation d’Apache Spark.
Intégration avec d’autres technologies
Vous constaterez souvent que Homebrew peut vous aider à travailler avec d’autres outils. Cette section présente deux exemples d’usage de Homebrew pour la data science :
- Comment installer Apache Spark avec Homebrew
- Comment utiliser Homebrew pour visualiser des arbres de décision
Installer Apache Spark avec Homebrew
Homebrew permet d’installer d’autres technologies comme Apache Spark. Apache Spark n’est pas le plus simple à installer, mais Homebrew simplifie la tâche. Suivez les étapes ci-dessous pour installer Apache Spark avec Homebrew.
1. Vérifiez s’il existe un paquet Apache Spark sur Homebrew avec la commande suivante.
brew search spark

2. Obtenez plus d’informations sur apache-spark pour vérifier que vous disposez de toutes les dépendances nécessaires.
brew info apache-spark
Si la sortie de la commande indique que Java est présent, passez à l’étape 3.

Si la sortie indique que les prérequis ne sont pas remplis, vous devez installer Java avant de passer à l’étape 3.

Vous pouvez taper la commande ci-dessous pour vérifier si Java est installé. L’image suivante montre la sortie lorsque Java n’est pas installé. Notez que si vous avez une version plus ancienne de Java, une mise à niveau sera nécessaire.
java -version

Vous pouvez installer Java avec Cask. Cask est une extension de brew qui permet de gérer des applications graphiques via le projet Cask.
brew tap caskroom/versions
brew cask install java8
Après l’installation de Java, vérifiez que vous avez une version appropriée de Java.
java -version

3. Utilisez la commande ci-dessous pour installer apache-spark.
brew install apache-spark

4. Vous pouvez maintenant ouvrir PySpark avec la commande ci-dessous.
pyspark

5. Vous pouvez fermer pyspark avec exit().
Pour en savoir plus sur PySpark, consultez le tutoriel Apache Spark : ML avec PySpark.
Utiliser Homebrew pour visualiser des arbres de décision
Graphviz est un logiciel libre de visualisation de graphes. La visualisation de graphes consiste à représenter des informations structurelles sous forme de diagrammes de graphes et réseaux abstraits. En data science, l’un des usages de Graphviz est la visualisation d’arbres de décision (vous pouvez en apprendre plus sur les arbres de décision ici).
Vous pouvez installer GraphViz avec la commande ci-dessous.
brew install graphviz
Le code Python ci-dessous ajuste un arbre de décision sur le célèbre jeu de données Iris et exporte un fichier dot (decisionTree.dot) de l’arbre entraîné.
from sklearn.datasets import load_iris
from sklearn import tree
iris = load_iris()
clf = tree.DecisionTreeClassifier(max_depth=3)
clf = clf.fit(iris.data, iris.target)
tree.export_graphviz(clf,
out_file="decisionTree.dot",
feature_names=iris.feature_names,
class_names=iris.target_names,
filled = True)
Un des points forts des arbres de décision est leur grande interprétabilité. Vous pouvez les interpréter plus facilement en les visualisant. C’est là que Graphviz intervient. Dans un terminal, tapez la commande ci-dessous pour convertir decisionTree.dot en un fichier .png facile à consulter.
dot -Tpng decisionTree.dot -o decisionTree.png
Vous pouvez ensuite ouvrir le fichier .png généré pour visualiser votre arbre de décision.

Il est important de noter que les fonctionnalités des gestionnaires de paquets se recoupent parfois. Par exemple, il est aussi possible d’installer Graphviz via la fonctionnalité de gestion de paquets de conda si vous avez Anaconda installé, avec la commande ci-dessous.
conda install python-graphviz
Conclusion
Ce tutoriel vous propose un guide rapide pour installer et utiliser Homebrew en data science. J’espère qu’il vous sera utile lorsque vous voudrez installer Apache Spark ou Graphviz. Homebrew dispose d’un excellent site web pour explorer d’autres commandes. Si vous avez des questions ou des remarques sur ce tutoriel, n’hésitez pas à les partager dans les commentaires ci-dessous ou sur Twitter.
Foire aux questions
Qu’est-ce que Homebrew et pourquoi est-il utile pour la data science sur macOS ?
Homebrew est un gestionnaire de paquets pour macOS qui simplifie l’installation, la mise à jour et la suppression de logiciels. Il est particulièrement utile en data science, car il facilite la gestion d’outils comme Apache Spark et Graphviz sur Mac.
Comment utiliser Homebrew pour installer Apache Spark ?
Commencez par rechercher le paquet Apache Spark avec brew search spark et vérifiez les dépendances (comme Java) via brew info apache-spark. Ensuite, installez Apache Spark avec brew install apache-spark.
Comment utiliser Homebrew pour visualiser des arbres de décision en data science ?
Vous pouvez installer Graphviz, un outil de visualisation de graphes, en exécutant brew install graphviz. Après l’installation, vous pouvez générer des représentations visuelles d’arbres de décision créés en Python en les convertissant en fichiers .png avec la commande dot -Tpng decisionTree.dot -o decisionTree.png.