1. Grundlegende Methoden für die Arbeit mit Excel-Dateien in pandas
Daten lesen mit read_excel
Um mit Excel-Dateien zu arbeiten, installiere zuerst pandas und openpyxl, falls du das noch nicht gemacht hast. Diese zwei Bibliotheken sind wie ein verlässliches altes Paar Schuhe – ohne sie kommt man in der Welt der Datenanalyse nicht weit.
pip install pandas openpyxl
Jetzt sind wir bereit, Tabellen zu verarbeiten. pandas bietet eine einfache und bequeme Methode read_excel, mit der man Daten aus Excel-Dateien in ein DataFrame laden kann – das Standarddatenformat in pandas.
import pandas as pd
# Lesen von Daten aus einer Excel-Datei
data = pd.read_excel('example.xlsx')
# Die ersten fünf Zeilen des DataFrame ausgeben
print(data.head())
Das war's schon! Wir haben Daten aus einer Excel-Datei gelesen und in ein DataFrame umgewandelt. Ein paar Millisekunden, und schon haben wir Daten auf dem Bildschirm, für die wir früher Excel starten mussten.
Parameter zum Lesen von Daten
Die Methode read_excel unterstützt viele Parameter, mit denen man Daten von einem bestimmten Blatt, aus einem bestimmten Zellbereich und mit Datentypangaben laden kann.
-
sheet_name: Gibt den Namen oder Index des Blatts an (beginnend bei 0), das gelesen werden soll. Zum Beispielsheet_name='Blatt1'odersheet_name=0. -
usecols: Ermöglicht die Auswahl bestimmter Spalten, die importiert werden sollen. Zum Beispielusecols="A:C", um nur die ersten drei Spalten zu wählen. -
skiprows: Überspringt die erstenNZeilen in der Datei. Nützlich, wenn du Kopfzeilen oder unnötige Daten am Anfang der Datei weglassen möchtest.
# Lesen von Daten von einem bestimmten Blatt und Auswahl von Spalten
data_filtered = pd.read_excel('example.xlsx', sheet_name='Blatt1', usecols="A:C", skiprows=2)
2. Umwandeln von Daten in ein DataFrame
Was ist ein DataFrame?
DataFrame ist wie die Elektronik für einen Roboter-Staubsauger: Von außen mag es einfach aussehen (nun ja, es ist nur eine Tabelle), aber genau dadurch weiß der Staubsauger, wohin er fahren soll, und DataFrame, welche Daten gespeichert und wie diese verarbeitet werden sollen.
Ein DataFrame in pandas ist eine zweidimensionale Datenstruktur mit Beschriftungen für Zeilen (Index) und Spalten. Im Gegensatz zu Standard-Python-Listen oder NumPy-Arrays ermöglicht ein DataFrame die Arbeit mit Daten wie in einer Datenbanktabelle oder Excel-Tabelle.
Grundlegende Operationen mit DataFrame
Eines der besten Features von DataFrame in pandas ist die Möglichkeit, mit den Daten sehr einfach zu interagieren. Zum Beispiel kannst du Daten sortieren, filtern oder Teilmengen von Zeilen und Spalten auswählen.
Spalten auswählen
Spalten werden einfach anhand ihrer Namen ausgewählt. Stell dir vor, du klickst in Excel auf die Kopfzeile einer Spalte, um sie auszuwählen. Hier ist es einfacher:
# Eine Spalte auswählen
dates = data['Datum']
# Mehrere Spalten auswählen
subset = data[['Name', 'Gehalt']]
Zeilen auswählen
Wenn du Zugriff auf Zeilen brauchst, kannst du die Methoden iloc für Indexierung und loc für Labels verwenden.
# Die erste Zeile auswählen
first_row = data.iloc[0]
# Zeilen mit einer Bedingung auswählen
high_salary = data[data['Gehalt'] > 50000]
3. Beispiele und Praxis
Jetzt, da wir ein grundlegendes Verständnis für die Datensammlung in einem DataFrame haben, lass uns etwas üben. Angenommen, wir haben eine Excel-Datei data.xlsx mit mehreren Blättern und möchten Daten von einem bestimmten Blatt extrahieren, sie verarbeiten und in der Konsole ausgeben.
Praktische Aufgabe
Deine Aufgabe: Schreibe ein Skript, das Daten aus der Datei data.xlsx liest, das Blatt Verkäufe auswählt und Verkäufe mit einem Betrag von über 1000 Einheiten filtert.
# Daten vom Blatt 'Verkäufe' lesen und filtern
sales_data = pd.read_excel('data.xlsx', sheet_name='Verkäufe')
high_sales = sales_data[sales_data['Betrag'] > 1000]
print(high_sales)
Diese Übung zeigt dir die Magie von pandas und gibt dir das Gefühl, ein Daten-Zauberer zu sein. Klar, es passiert nichts Übernatürliches, aber Tabellen werden in nützliche Informationen umgewandelt – und in der Welt der Datenanalyse ist das echte Magie!
4. Fehler und besondere Implementierungsdetails
Anfänger vergessen oft Kleinigkeiten, wie die Groß- und Kleinschreibung von Spaltennamen oder dass pandas standardmäßig die erste Zeile als Kopfzeilen betrachtet. Wenn deine Daten anders sind, kannst du auf Fehler stoßen. Sei mit deinen Daten befreundet: Überprüfe immer die Spaltennamen nach dem Laden der Datei, indem du print(data.columns) verwendest.
Und noch ein wichtiger Punkt: Wenn du Dateien von großen Unternehmen lädst, können die Daten verschlüsselt sein. pandas kann hier nicht helfen, aber eine Tasse starker Kaffee und eine Pause bestimmt!
All dieses Wissen wird dir helfen, Routineaufgaben bei der Arbeit mit Excel-Daten zu automatisieren. Die Automatisierung dieser Prozesse spart nicht nur Zeit, sondern befreit dich auch von logistischen Albträumen, die mit Kopieren und Einfügen verbunden sind. Deine Python-Skripte werden als automatische Assistenten auftreten, die in der Lage sind, Berichtsdaten sofort vorzubereiten.
GO TO FULL VERSION