1. ホーム
  2. python

[解決済み] Pandasのgroupby。文字列の結合を取得する方法

2022-06-22 19:31:28

質問

このようなデータフレームがあります。

   A         B       C
0  1  0.749065    This
1  2  0.301084      is
2  3  0.463468       a
3  4  0.643961  random
4  1  0.866521  string
5  2  0.120737       !

呼び出し

In [10]: print df.groupby("A")["B"].sum()

A
1    1.615586
2    0.421821
3    0.463468
4    0.643961

さて、私は列 "C"に対して同じ"を行いたいと思います。この列は文字列を含むので、sum()は動作しません(文字列を連結すると思うかもしれませんが)。私が本当に見たいのは、各グループの文字列のリストまたはセットです。

A
1    {This, string}
2    {is, !}
3    {a}
4    {random}

という方法を考えてみました。

Series.unique() ( http://pandas.pydata.org/pandas-docs/stable/generated/pandas.Series.unique.html ) は動作しませんが

df.groupby("A")["B"]

pandas.core.groupby.SeriesGroupBy object

となっているので、Seriesの方法なら何でもいいと思っていました。何かアイデアはありますか?

どのように解決するのですか?

In [4]: df = read_csv(StringIO(data),sep='\s+')

In [5]: df
Out[5]: 
   A         B       C
0  1  0.749065    This
1  2  0.301084      is
2  3  0.463468       a
3  4  0.643961  random
4  1  0.866521  string
5  2  0.120737       !

In [6]: df.dtypes
Out[6]: 
A      int64
B    float64
C     object
dtype: object

自作関数を適用した場合、数値以外の列の自動排除は行われない。の適用より遅いですが、これは .sum() を適用すると groupby

In [8]: df.groupby('A').apply(lambda x: x.sum())
Out[8]: 
   A         B           C
A                         
1  2  1.615586  Thisstring
2  4  0.421821         is!
3  3  0.463468           a
4  4  0.643961      random

sum はデフォルトで連結されます。

In [9]: df.groupby('A')['C'].apply(lambda x: x.sum())
Out[9]: 
A
1    Thisstring
2           is!
3             a
4        random
dtype: object

かなり好きなことができる

In [11]: df.groupby('A')['C'].apply(lambda x: "{%s}" % ', '.join(x))
Out[11]: 
A
1    {This, string}
2           {is, !}
3               {a}
4          {random}
dtype: object

これをフレーム全体で、1グループずつ行っています。キーは Series

def f(x):
     return Series(dict(A = x['A'].sum(), 
                        B = x['B'].sum(), 
                        C = "{%s}" % ', '.join(x['C'])))

In [14]: df.groupby('A').apply(f)
Out[14]: 
   A         B               C
A                             
1  2  1.615586  {This, string}
2  4  0.421821         {is, !}
3  3  0.463468             {a}
4  4  0.643961        {random}