1. Méthodes principales pour travailler avec des fichiers Excel dans pandas
Lecture de données avec read_excel
Pour travailler avec des fichiers Excel, commence par installer pandas et openpyxl, si ce n'est pas déjà fait. Ces deux bibliothèques sont comme une vieille paire de chaussures fiables — sans elles, impossible d'entrer dans le monde de l'analyse de données.
pip install pandas openpyxl
Maintenant, on est prêts à dévorer des tables. pandas offre une méthode simple et pratique read_excel, qui permet de charger des données de fichiers Excel dans un DataFrame — le format standard des données dans pandas.
import pandas as pd
# Lecture des données depuis un fichier Excel
data = pd.read_excel('example.xlsx')
# Affichage des cinq premières lignes du DataFrame
print(data.head())
Et voilà ! On vient de lire les données depuis un fichier Excel et les transformer en DataFrame. En quelques millisecondes, hop, déjà transformées en données visibles, là où avant il fallait ouvrir Excel.
Paramètres pour la lecture des données
La méthode read_excel prend en charge de nombreux paramètres, qui permettent de lire des données à partir d'une feuille spécifique, d'une plage de cellules ou en précisant des formats de données.
-
sheet_name: Indique le nom ou l'index (à partir de 0) de la feuille à lire. Par exemple,sheet_name='Feuille1'ousheet_name=0. -
usecols: Permet de sélectionner des colonnes spécifiques que tu veux importer. Par exemple,usecols="A:C"pour choisir uniquement les trois premières colonnes. -
skiprows: Permet d'ignorer les premièresNlignes dans le fichier. Utile pour sauter des en-têtes ou des données inutiles au début du fichier.
# Lecture des données depuis une feuille spécifique et sélection des colonnes
data_filtered = pd.read_excel('example.xlsx', sheet_name='Feuille1', usecols="A:C", skiprows=2)
2. Transformation des données en DataFrame
C'est quoi un DataFrame ?
Un DataFrame, c'est comme l'électronique d'un robot aspirateur : de l'extérieur, ça a l'air simple (ok, juste un tableau), mais c'est grâce à lui que le robot sait où aller, et le DataFrame — quelles données stocker et comment les traiter.
Le DataFrame dans pandas est une structure de données bidimensionnelle, qui comporte des étiquettes sur les lignes (index) et colonnes. Contrairement aux listes Python classiques ou aux tableaux NumPy, le DataFrame permet de manipuler les données comme un tableau dans une base de données ou dans Excel.
Opérations de base avec un DataFrame
Une des meilleures caractéristiques du DataFrame dans pandas, c'est presque la simplicité avec laquelle on peut interagir avec les données. Par exemple, tu peux trier des données, les filtrer ou sélectionner un sous-ensemble de lignes et colonnes.
Sélectionner des colonnes
Pour sélectionner une colonne, on utilise simplement ses noms. Souviens-toi, comme dans Excel : tu cliques sur l'en-tête d'une colonne pour la sélectionner. Ici, pareil :
# Sélection d'une seule colonne
dates = data['Date']
# Sélection de plusieurs colonnes
subset = data[['Nom', 'Salaire']]
Sélectionner des lignes
Si tu as besoin d'accéder aux lignes, tu peux utiliser les méthodes iloc pour indexation et loc pour travailler avec des étiquettes.
# Sélection de la première ligne
first_row = data.iloc[0]
# Sélection des lignes avec condition
high_salary = data[data['Salaire'] > 50000]
3. Exemples et pratique
Maintenant qu'on a une compréhension de base de la collection des données dans un DataFrame, pratiquons un peu. Disons qu'on a un fichier Excel data.xlsx avec plusieurs feuilles, et on veut extraire des données d'une feuille en particulier, les traiter et les imprimer dans la console.
Exercice pratique
Ton objectif : écris un script qui lira les données du fichier data.xlsx, sélectionnera la feuille Ventes et filtrera les ventes avec un total supérieur à 1000 unités.
# Lecture des données depuis la feuille 'Ventes' et filtrage
sales_data = pd.read_excel('data.xlsx', sheet_name='Ventes')
high_sales = sales_data[sales_data['Montant'] > 1000]
print(high_sales)
Cet exercice te permettra de ressentir la magie de pandas et de te sentir un peu comme un magicien des données. Pas de sorcellerie ici, mais transformer les tableaux en informations utiles, dans le monde de l'analyse, c'est déjà magique !
4. Erreurs courantes et subtilités
Souvent, les débutants oublient des petits détails, comme les noms des colonnes sensibles à la casse, ou encore que pandas considère par défaut la première rangée comme des en-têtes. Si tes données sont différentes, tu risques des erreurs. Sois en bons termes avec tes données : vérifie toujours les noms des colonnes après avoir chargé un fichier, en utilisant print(data.columns).
Et une autre chose importante : si tu essaies de charger des fichiers créés par de grosses entreprises, il est possible que les données soient cryptées. pandas ne peut rien y faire, mais une tasse de café bien fort et une pause peuvent t'aider !
Toutes ces connaissances peuvent t'aider à automatiser la routine quand tu dois travailler avec des données Excel. Automatiser ces processus te fera gagner du temps et te débarrassera des cauchemars logistiques liés au copier-coller. Tes scripts Python joueront le rôle d'assistants automatiques capables de préparer des rapports instantanément.
GO TO FULL VERSION