day-037-Pandas数据读取

发布时间:2026/7/22 4:01:29

day-037-Pandas数据读取 Day 37Pandas 数据读取——从各种来源加载数据昨天手动创建了 DataFrame。现实中数据通常来自文件。今天学如何从 CSV、Excel、JSON、数据库等各类数据源中读取数据到 DataFrame。一、读取 CSV——最常用的数据源importpandasaspd# 基本读取dfpd.read_csv(data.csv)# 常用参数一览dfpd.read_csv(data.csv,encodingutf-8,# 编码sep,,# 分隔符默认逗号header0,# 第几行作为列名0第一行index_col0,# 把第几列作为行索引usecols[姓名,成绩],# 只读取指定列nrows100,# 只读前100行skiprows2,# 跳过前2行dtype{年龄:int},# 指定列的数据类型na_values[NA,缺失],# 把指定值当作 NaN)print(df.head())# 前5行print(df.tail(3))# 后3行实战读取真实数据集# 读取一个典型的 CSVdfpd.read_csv(students.csv,encodingutf-8)print(f形状{df.shape})print(f列名{list(df.columns)})print(f每列类型\n{df.dtypes})print(f\n前3行\n{df.head(3)})处理中文乱码# 尝试顺序utf-8 → gbk → gb2312 → gb18030encodings[utf-8,utf-8-sig,gbk,gb2312,gb18030,latin-1]forencinencodings:try:dfpd.read_csv(data.csv,encodingenc)print(f成功用{enc}编码读取)breakexceptUnicodeDecodeError:print(f{enc}失败尝试下一个...)continue二、写入 CSVdf.to_csv(output.csv,indexFalse,# 不保存行索引encodingutf-8-sig,# utf-8-sig 让 Excel 能正确打开中文sep,,columns[姓名,成绩],# 只保存指定列)为什么用utf-8-sig而不是utf-8utf-8标准编码但 Excel 打开时中文会乱码utf-8-sig在文件头加 BOMExcel 能正确识别中文三、读取 Excel# 先安装pip install openpyxl# 读取 Exceldfpd.read_excel(data.xlsx,sheet_nameSheet1,# 工作表名或索引 0header1,# 第2行作为列名usecolsA:D,# 只读 A-D 列nrows50,)# 读取所有工作表all_sheetspd.read_excel(data.xlsx,sheet_nameNone)forname,sheet_dfinall_sheets.items():print(f工作表 {name}{sheet_df.shape})# 写入 Excelwithpd.ExcelWriter(output.xlsx,engineopenpyxl)aswriter:df.to_excel(writer,sheet_name学生成绩,indexFalse)df.to_excel(writer,sheet_name备份,indexFalse)四、读取 JSON# 读取 JSON 文件dfpd.read_json(data.json)print(df)# 读取嵌套 JSON带结构的importjsonwithopen(api_data.json,r,encodingutf-8)asf:datajson.load(f)# 用 json_normalize 展平嵌套结构dfpd.json_normalize(data,record_path[results],# 记录所在的路径meta[page,total]# 保留的元数据字段)五、其他数据源速览# SQL 数据库需要 pip install sqlalchemy 数据库驱动fromsqlalchemyimportcreate_engine enginecreate_engine(sqlite:///database.db)dfpd.read_sql(SELECT * FROM students WHERE score 80,engine)# HTML 网页中的表格tablespd.read_html(https://example.com/data-table.html)dftables[0]# 第一个 table 标签# 剪贴板复制表格后直接在 Python 中读取dfpd.read_clipboard()# 从剪贴板读取# 字典/列表直接转 DataFramedata[{name:小明,score:85},{name:小红,score:92},]dfpd.DataFrame(data)# NumPy 数组转 DataFrameimportnumpyasnp arrnp.array([[1,2,3],[4,5,6]])dfpd.DataFrame(arr,columns[A,B,C])六、了解你的数据——读取后的第一步dfpd.read_csv(data.csv,encodingutf-8)# 第一件事概览print(f行数{len(df)}列数{len(df.columns)})print(f列名{list(df.columns)})# 查看前几行和后几行print(df.head())print(df.tail())# 查看基本统计print(df.describe())# 数值列统计print(df.describe(includeall))# 包含非数值列# 查看缺失值print(df.isnull().sum())# 每列有多少缺失值# 查看每列的唯一值数量print(df.nunique())七、实战加载并初步探索一个数据集# 创建一个模拟数据集然后探索importpandasaspdimportnumpyasnp np.random.seed(42)# 模拟网上商店订单数据n1000dfpd.DataFrame({order_id:range(1001,1001n),customer:np.random.choice([张三,李四,王五,赵六],n),product:np.random.choice([手机,电脑,平板,耳机,手表],n),price:np.random.uniform(50,5000,n).round(2),quantity:np.random.randint(1,5,n),date:pd.date_range(2026-01-01,periodsn,freqh),})# 保存为 CSVdf.to_csv(orders.csv,indexFalse,encodingutf-8-sig)# 重新加载并探索orderspd.read_csv(orders.csv,encodingutf-8-sig,parse_dates[date])# 自动解析日期列print(f数据集{orders.shape[0]}条订单{orders.shape[1]}列)print(f日期范围{orders[date].min()}~{orders[date].max()})print(f总销售额{orders[price].sum():,.2f})print(f每单均价{orders[price].mean():.2f})八、今日学习总结学习内容掌握情况一句话要点pd.read_csv()✅ 重点CSV 是最常用的数据来源编码处理✅ 重点utf-8 不行试 gbk写文件用 utf-8-sigpd.read_excel()✅ 了解需要 openpyxlpd.read_json()✅ 了解JSON 转 DataFrame数据概览✅ 重点head/info/describe/isnull/sum/nunique其他数据源✅ 了解SQL/HTML/剪贴板/NumPy今日踩坑记录CSV 第一列变成乱码存了 utf-8 但带 BOM 头。用encodingutf-8-sig读取。大文件 read_csv 太慢用nrows100先看前100行确定列名和类型再用dtype指定类型能快很多。日期列被当成字符串read_csv默认不解析日期。用parse_dates[date_column]参数。九、明天学什么学会了读取数据明天学 Pandas 的核心技能——数据清洗处理缺失值、重复值、类型转换、异常值。数据科学 80% 的时间在清洗数据。Pandas 让这个过程从痛苦变成顺手。第37天打卡完成。明天见本系列是个人学习笔记如有错误欢迎在评论区指正交流。

相关新闻