章节导读

pandas 的文本处理核心是 .str 访问器,它将 Python 字符串方法与正则表达式向量化,使整列字符串操作无需编写循环。本章从访问器机制出发,系统覆盖字符串的基础操作、查找判断、拆分连接、正则提取、类型转换与性能优化。

本章包含:


快速索引

.str 方法总览

类别方法
大小写lower、upper、title、capitalize、swapcase、casefold
空白处理strip、lstrip、rstrip
填充对齐pad、center、zfill、ljust、rjust
长度与计数len、count
判断与搜索contains、startswith、endswith、match、fullmatch
替换replace
拆分split、rsplit、slice、get、slice_replace
连接cat、join
提取extract、extractall、findall
格式化format
编码encode、decode
翻译translate

工作流程建议

graph LR
    A[原始文本列] --> B[统一格式]
    B --> C[查找定位]
    C --> D[拆分结构]
    D --> E[提取目标字段]
    E --> F[类型转换]
    F --> G[分析与建模]

与 6.5 文本清洗的关系

章节角度
6.5 文本清洗-2面向数据清洗流程,解决脏数据问题(空格、缺失标记、统一格式)
本章(七、文本处理)面向文本处理全体系,提供完整、系统化的字符串与正则方法

学习建议

  • 若只需快速清理文本,可直接查阅 6.5 文本清洗-2
  • 若需完整掌握字符串向量化操作、正则提取或文本转换,以本章为主线