(include, exclude, percentiles, subset)
| 399 | ], |
| 400 | ) |
| 401 | def test_describe(include, exclude, percentiles, subset): |
| 402 | data = { |
| 403 | "a": ["aaa", "bbb", "bbb", None, None, "zzz"] * 2, |
| 404 | "c": [None, 0, 1, 2, 3, 4] * 2, |
| 405 | "d": [None, 0, 1] * 4, |
| 406 | "e": [ |
| 407 | pd.Timestamp("2017-05-09 00:00:00.006000"), |
| 408 | pd.Timestamp("2017-05-09 00:00:00.006000"), |
| 409 | pd.Timestamp("2017-05-09 07:56:23.858694"), |
| 410 | pd.Timestamp("2017-05-09 05:59:58.938999"), |
| 411 | None, |
| 412 | None, |
| 413 | ] |
| 414 | * 2, |
| 415 | "f": [ |
| 416 | np.timedelta64(3, "D"), |
| 417 | np.timedelta64(1, "D"), |
| 418 | None, |
| 419 | None, |
| 420 | np.timedelta64(3, "D"), |
| 421 | np.timedelta64(1, "D"), |
| 422 | ] |
| 423 | * 2, |
| 424 | "g": [True, False, True] * 4, |
| 425 | } |
| 426 | |
| 427 | # Arrange |
| 428 | df = pd.DataFrame(data) |
| 429 | df["a"] = df["a"].astype(get_string_dtype()) |
| 430 | |
| 431 | if subset is not None: |
| 432 | df = df.loc[:, subset] |
| 433 | |
| 434 | ddf = dd.from_pandas(df, 2) |
| 435 | |
| 436 | # Act |
| 437 | actual = ddf.describe( |
| 438 | include=include, |
| 439 | exclude=exclude, |
| 440 | percentiles=percentiles, |
| 441 | ) |
| 442 | expected = df.describe( |
| 443 | include=include, |
| 444 | exclude=exclude, |
| 445 | percentiles=percentiles, |
| 446 | ) |
| 447 | |
| 448 | if "e" in expected: |
| 449 | expected = _drop_mean(expected, "e") |
| 450 | |
| 451 | assert_eq(actual, expected) |
| 452 | |
| 453 | # Check series |
| 454 | if subset is None: |
| 455 | for col in ["a", "c", "e", "g"]: |
| 456 | expected = df[col].describe(include=include, exclude=exclude) |
| 457 | if col == "e": |
| 458 | expected = _drop_mean(expected) |
nothing calls this directly
no test coverage detected