直接用awk、cut、sed处理CSV仅在无引号、无嵌套逗号、无空字段时安全;遇"New York, NY"等场景会错位,属工具能力边界问题,应改用csvtool或Python csv模块。
直接用
、
、
处理 CSV 文件,只在字段简单、无引号、无嵌套逗号时才安全;一旦出现
或空字段,
就会错位——这不是你脚本写错了,是工具能力边界问题。
用
提取列:快但脆弱
适合纯 ASCII、无引号、无空字段的 CSV(比如日志导出或内部脚本生成的数据)。
提取第 2 和第 4 列,分隔符必须严格是逗号;若某行含
,
会切出 5 段,
拿到的是
和
,而非预期的
和
字段含前后空格时,
不清洗,输出如
,后续
或数值比较易失败
不支持跳过表头,得靠
手动绕过
用
做基础清洗和筛选
比
强,能跳过空行、做简单条件判断、格式化输出,但仍无法正确解析带引号的嵌套逗号。
:跳过空行(
)、过滤第三列大于 25 的行,并打印第一、三列
字段含空格?加
清洗首尾空白
想把 age 列转成“28岁”?用
,别用
,否则可能多空行
若某行只有两列而你读
,awk 不报错,而是返回空字符串——容易静默出错,建议先检查
用
处理带逻辑的逐行操作
适合需要 shell 变量参与判断、调用外部命令(如
解析时间)、或组合多个条件的场景。
必须设
,否则默认按空白分割;加
防止反斜杠被吃掉:
表头跳过写成
,别依赖行号,因为可能有空行干扰
字段本身含逗号?
会直接劈开,无法恢复——这时已超出 shell 内建能力,该换工具
性能差:每行启动一次子 shell,处理百万行 CSV 明显慢于
什么时候必须放弃 shell,改用专业工具
当 CSV 出现以下任一情况,硬撑只会让脚本越来越难维护:
字段含引号包裹的逗号,例如
字段含换行符(合法 CSV 允许引号内换行)
需处理 UTF-8 中文、BOM 头、或混合编码
要验证字段类型(如强制
是整数)、做跨行聚合(如按城市统计平均年龄)
此时应切换到
(Debian/Ubuntu 自带)或 Python 的
模块——不是“更高级”,而是它们专为 CSV RFC 4180 设计,shell 工具根本没打算解决这个问题。
awkcutsed"New York, NY"cut -d',' -f3cutcut -d',' -f2,4 data.csv"a,b",c,dcut-f2,4bca,bdcut "Alice" greptail -n +2 data.csv | cut ...awkcutawk -F',' 'NF && $3 > 25 {print $1, $3}' data.csvNFgsub(/^[[:space:]]+|[[:space:]]+$/, "", $1)printf "%s %d岁\n", $1, $3print$3NF >= 3while readdate -dIFS=','-rwhile IFS=',' read -r id name age city; do ...if [ "$id" = "id" ]; then continue; fireadawk"John, Doe",32,"San Francisco"$3csvtoolcsv