新闻资讯
只需三五行代码即可产出完美数据分析报告,这四大 AutoEDA 工具包真的太棒了!
记得在四年前,我们做数据建模或者比赛项目时,在前期我们会耗费大量的时间去分析数据、数据可视化。
但现在我们可以看到,很多数据处理方式都被集成了,开发了很多 AutoEDA 的工具包,帮助我们节省大量时间,这对于刚刚学习数据分析的小伙伴可以带来非常大的帮助。
本篇文章我们介绍目前最流行的四大AutoEDA工具包。
-
D-tale
-
Pandas-Profiling
-
Sweetviz
- AutoViz
这几个工具包可以以短短三五行代码帮新手节省将近一天时间去写代码分析,非常建议大家收藏学习,喜欢点赞支持。
介绍
01 D-Tale
D-Tale是Flask后端和React前端组合的产物,也是一个开源的Python自动可视化库,可以为我们提供查看和分析Pandas DataFrame的方法,帮助我们获得非常数据的详细EDA。
目前D-Tale支持DataFrame、Series、MultiIndex、DatetimeIndex 和 RangeIndex 等 Pandas对象。
Github 链接
https://github.com/man-group/dtale
import dtale import pandas as pd df = pd.read_csv('./data/titanic.csv') d = dtale.show(df) d.open_browser()
02 Pandas-Profiling
Pandas-Profiling可以对Pandas DataFrame生成report报告。其中:
- pandas_profiling的df.profile_report()扩展了pandas DataFrame以方便进行快速数据分析。
Pandas-Profiling对于每一列特征,特征的统计信息(如果与列类型相关)会显示在交互式 HTML的report中:
-
Type:检测数据列类型;
-
Essentials:类型、unique值、缺失值
-
分位数统计,如最小值、Q1、中位数、Q3、最大值、范围、四分位距
-
描述性统计数据,如均值、众数、标准差、总和、中值绝对偏差、变异系数、峰态、偏度
-
出现最多的值
-
直方图
-
高度相关变量、Spearman、Pearson 和 Kendall 矩阵的相关性突出显示
-
缺失值矩阵、计数、热图和缺失值树状图
- …
一个特征的案例
03 Sweetviz
Sweetviz也是一个开源Python库,Sweetviz可以用简短几行代码生成美观、高密度的可视化文件,只需两行代码即可开启探索性数据分析并输出一个完全独立的 HTML 应用程序。Sweetviz主要包含下面的分析:
-
数据集概述
-
变量属性
-
类别的关联性
-
数值关联性
- 数值特征最频繁值、最小、最大值
04 AutoViz
AutoViz可以使用一行自动显示任何数据集。给出任何输入文件(CSV、txt或json),AutoViz都可以对其进行可视化。AutoViz的结果会以非常多的图片都形式存在文件夹下方。
-
诸多文件全都在当前文件夹下方
- 我们打开其中一个效果如下
适用问题
适用于所有的数据分析问题。
回复列表