内容
2つのデータ(df_1とdf_2)をpd.mergeを用いて
結合したデータ(edit_df)を作りたいのですが、なぜか行数が増えてしまいます。
df_1の行数は3644、df_2の行数は3576です。
下図にあるように、お互いの共通カラムである'個体識別番号’をkeyに結合します。
df_2の'個体識別番号'は全てdf_1の'個体識別番号'に含まれています。
逆に言えば、df_1の'個体識別番号'の一部はdf_2の'個体識別番号'に含まれていません。
つまり、結合後の行数はdf_2と同じ3576になるはずですが、
なぜか少し増えて3685になってしまいます。
もし正しい方法がわかる方がいらっしゃれば教えていただければ幸いです。
データ
【df_1】
【df_2】
【edit_df】
気づいたこと
edit_dfのインデックス番号3681〜3683は全て同じ'個体識別番号'および'名号'になっています。
正しいのは3683番目だけで、3681番目と3682番目は不要な行です。
おそらくこういうのが行数が増えている原因と思われます。
最後に
はじめて質問するので、以上の情報だけではわからないというご意見があればお教えください。
その際は、改めて情報を追加させていただきます。
よろしくお願いいたします。

0 コメント