1. pandasでExcelファイルを操作する基本的な方法
read_excelを使ったデータの読み込み
Excelファイルの操作を始めるには、まず pandasとopenpyxlをインストールする必要があります。 これら2つは信頼できる古い靴みたいなものです。これがないとデータ分析の世界には足を踏み入れられません。
pip install pandas openpyxl
これで表データを処理する準備が整いました。 pandasには便利なread_excelメソッドがあります。このメソッドを使えば、 Excelファイルからデータを読み込んで、DataFrameフォーマット(pandasの標準データ形式)に 変換できます。
import pandas as pd
# Excelファイルからデータを読み込み
data = pd.read_excel('example.xlsx')
# DataFrameの最初の5行を表示
print(data.head())
これで完了!Excelファイルからデータを読み込み、 DataFrameに変換しました。ほんの数ミリ秒で、以前ならExcelを開くことが必要だったデータが画面に表示されます。
データを読み込む際のパラメータ
read_excelメソッドは多くのパラメータをサポートしています。 これにより、特定のシートやセル範囲を指定してデータを読み込んだり、 データ形式を指定したりできます。
-
sheet_name: 読み込みたいシート名またはそのインデックス(0から開始)を指定します。 例:sheet_name='シート1'またはsheet_name=0。 -
usecols: インポートしたい特定の列を選択します。例えば、usecols="A:C"を指定すると、最初の3列だけが選択されます。 -
skiprows: 最初のN行をスキップすることができます。 これは、ファイル冒頭のヘッダーや不要なデータをスキップする際に便利です。
# 特定のシートからデータを読み込み、列を選択
data_filtered = pd.read_excel('example.xlsx', sheet_name='シート1', usecols="A:C", skiprows=2)
2. データをDataFrameに変換する
DataFrameとは何か?
DataFrameはロボット掃除機の電子頭脳みたいなもので、外からは単なる表形式に見えるけど、 実はこれがあるから掃除機が進むべき方向を知り、またDataFrameがデータを保存し、それを 処理する方法を決めるんだよ。
pandasのDataFrameは、行(インデックス)と列のラベルが付いた 2次元のデータ構造です。標準のPythonリストやNumPy配列と異なり、 DataFrameはデータベースやExcelのテーブルのように扱うことができます。
DataFrameの基本操作
pandasのDataFrameで最高なのは、 データを使うのがめちゃくちゃ簡単なところです。 例えば、データを並び替えたり、フィルタリングしたり、 行や列の一部分を選択することができます。
列の選択
列を選択するには名前を使うだけ。Excelで列のヘッダーをクリックして選択するのと同じ感じです。 これより簡単な操作はないよ:
# 1つの列の選択
dates = data['日付']
# 複数列の選択
subset = data[['名前', '給与']]
行の選択
行にアクセスしたい場合、ilocメソッドを使って インデックスで操作したり、locを使って ラベルで操作することができます。
# 最初の行を選択
first_row = data.iloc[0]
# 条件付きで行を選択
high_salary = data[data['給与'] > 50000]
3. 例と練習
DataFrameでデータを操作する基本を理解したので、 少し練習してみましょう。例えば、data.xlsxというExcelファイルがあって、 複数のシートがあります。この中から特定のシートのデータを抽出し、それを加工して コンソールに表示することを目指しましょう。
実践課題
課題: data.xlsxファイルを読み込み、 販売シートを選択して、1000以上の販売金額があるデータを フィルタリングするスクリプトを作成してください。
# '販売'シートを読み込み、フィルタリング
sales_data = pd.read_excel('data.xlsx', sheet_name='販売')
high_sales = sales_data[sales_data['金額'] > 1000]
print(high_sales)
この課題をやってみると、pandasの魔法を感じられるはずです。 本当の魔法ではないけれど、テーブルが価値ある情報に変わる…それは データ分析の世界では本物の魔法に匹敵します!
4. エラーと実装の注意点
初心者がよく忘れるのが小さな注意点です。例えば、大文字小文字を区別した 列名の確認や、pandasがデフォルトで最初の行をヘッダーとして扱うことなど。 データが異なれば、エラーにぶつかるかもしれません。 ファイルを読み込んだ後、print(data.columns)を使って 列名を確認する癖をつけましょう。
もう1つ重要なポイントは、もし大企業が作ったファイルを読み込む場合、 その中のデータは暗号化されている可能性があるということです。 pandasでは対処できませんが、コーヒーを飲んで休憩すれば きっと新しいアイデアが浮かんでくるはずです!
これらの知識を活用すると、Excelデータの処理が自動化されて、 ルーティンワークの時間を節約できます。自分のPythonスクリプトが アシスタントのように振る舞い、 必要なレポートデータを瞬時に生成してくれるようになりますよ!
GO TO FULL VERSION