Python 做数据分析通常遵循一套比较成熟的流程,从数据获取 → 清洗 → 分析 → 可视化 → 输出结论。下面我用「步骤 + 常用库 + 示例代码」的方式给你一个清晰入门指南。
常用工具:
pandas:数据处理numpy:数值计算matplotlib / seaborn:可视化scikit-learn:建模(进阶)安装:
pip install pandas numpy matplotlib seaborn
import pandas as pd
df = pd.read_csv("data.csv")
# 其他格式
# pd.read_excel("data.xlsx")
# pd.read_sql("SELECT * FROM table", conn)
查看数据:
df.head()
df.info()
df.describe()
常见问题处理:
缺失值
df.isnull().sum()
df.dropna(inplace=True) # 删除缺失
df.fillna(0, inplace=True) # 填充
重复值
df.drop_duplicates(inplace=True)
类型转换
df["date"] = pd.to_datetime(df["date"])
df.describe()
df["category"].value_counts()
分组统计:
df.groupby("category")["sales"].mean()
import matplotlib.pyplot as plt
import seaborn as sns
sns.histplot(df["sales"])
plt.show()
sns.boxplot(x="category", y="sales", data=df)
plt.show()
常见图:
from sklearn.linear_model import LinearRegression
X = df[["ad_spend"]]
y = df["sales"]
model = LinearRegression()
model.fit(X, y)
df.to_csv("result.csv", index=False)
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
df = pd.read_csv("sales.csv")
df.dropna(inplace=True)
print(df.groupby("region")["profit"].sum())
sns.barplot(x="region", y="profit", data=df)
plt.show()
如果你愿意,可以告诉我:
我可以直接给你针对性的学习路径或代码模板。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。