DataFrame.describe() / Series.describe()

Метод describe() возвращает сводную статистику числовых столбцов: количество, среднее, стандартное отклонение, минимум, квартили, максимум. Для нечисловых данных показывает количество, число уникальных значений, моду и её частоту.

Сигнатура

DataFrame.describe(percentiles=None, include=None, exclude=None)
Series.describe(percentiles=None, include=None, exclude=None)

Параметры

  • percentiles — список перцентилей (default [0.25, 0.5, 0.75]).

  • include — типы для включения ("all", [np.number] и т. п.).

  • exclude — типы для исключения.

Возвращаемое значение

Series (для Series) или DataFrame (для DataFrame) со статистиками.

Примеры

Пример 1. Описание числовой Series

import pandas as pd

s = pd.Series([1, 2, 3, 4, 5, 6, 7])
print(s.describe())
count    7.000000
mean     4.000000
std      2.160247
min      1.000000
25%      2.500000
50%      4.000000
75%      5.500000
max      7.000000
dtype: float64

Пример 2. Статистика по показаниям датчиков

import pandas as pd

df = pd.DataFrame({
    "temp":     [22.1, 22.5, 22.3, 22.8, 22.4],
    "humidity": [55, 57, 56, 60, 58],
})
print(df.describe().round(2))
        temp  humidity
count   5.00      5.00
mean   22.42     57.20
std     0.27      1.92
min    22.10     55.00
25%    22.30     56.00
50%    22.40     57.00
75%    22.50     58.00
max    22.80     60.00

Пример 3. Нечисловая Series

import pandas as pd

s = pd.Series(["A", "B", "A", "C", "A"])
print(s.describe())
count     5
unique    3
top       A
freq      3
dtype: object

Пример 4. Пользовательские перцентили

import pandas as pd

s = pd.Series(range(1, 101))
print(s.describe(percentiles=[0.1, 0.9]))
count    100.000000
mean      50.500000
std       29.011492
min        1.000000
10%       10.900000
50%       50.500000
90%       90.100000
max      100.000000
dtype: float64

Пример 5. include=»all»

import pandas as pd

df = pd.DataFrame({"a": [1, 2, 3], "name": ["x", "y", "x"]})
print(df.describe(include="all"))
          a name
count   3.0    3
unique  NaN    2
top     NaN    x
freq    NaN    2
mean    2.0  NaN
std     1.0  NaN
min     1.0  NaN
25%     1.5  NaN
50%     2.0  NaN
75%     2.5  NaN
max     3.0  NaN

См. также

Примечание

Лицензия и источники

Техническое описание функции адаптировано из официальной документации Pandas (https://pandas.pydata.org/docs/), BSD-3-Clause License. Примеры и пояснения — © AlashEd Wiki.