跳转到主内容
趣航编程网 - 趣学编程,启航技术之路!

Linux如何使用Shell处理CSV文件_Linux Shell处理CSV文件攻略

直接用awk、cut、sed处理CSV仅在无引号、无嵌套逗号、无空字段时安全;遇"New York, NY"等场景会错位,属工具能力边界问题,应改用csvtool或Python csv模块。 直接用
awk
cut
sed
处理 CSV 文件,只在字段简单、无引号、无嵌套逗号时才安全;一旦出现
"New York, NY"
或空字段,
cut -d',' -f3
就会错位——这不是你脚本写错了,是工具能力边界问题。 用
cut
提取列:快但脆弱 适合纯 ASCII、无引号、无空字段的 CSV(比如日志导出或内部脚本生成的数据)。
cut -d',' -f2,4 data.csv
提取第 2 和第 4 列,分隔符必须严格是逗号;若某行含
"a,b",c,d
cut
会切出 5 段,
-f2,4
拿到的是
b
c
,而非预期的
a,b
d
字段含前后空格时,
cut
不清洗,输出如
"Alice"
,后续
grep
或数值比较易失败 不支持跳过表头,得靠
tail -n +2 data.csv | cut ...
手动绕过 用
awk
做基础清洗和筛选 比
cut
强,能跳过空行、做简单条件判断、格式化输出,但仍无法正确解析带引号的嵌套逗号。
awk -F',' 'NF && $3 > 25 {print $1, $3}' data.csv
:跳过空行(
NF
)、过滤第三列大于 25 的行,并打印第一、三列 字段含空格?加
gsub(/^[[:space:]]+|[[:space:]]+$/, "", $1)
清洗首尾空白 想把 age 列转成“28岁”?用
printf "%s %d岁\n", $1, $3
,别用
print
,否则可能多空行 若某行只有两列而你读
$3
,awk 不报错,而是返回空字符串——容易静默出错,建议先检查
NF >= 3
while read
处理带逻辑的逐行操作 适合需要 shell 变量参与判断、调用外部命令(如
date -d
解析时间)、或组合多个条件的场景。 必须设
IFS=','
,否则默认按空白分割;加
-r
防止反斜杠被吃掉:
while IFS=',' read -r id name age city; do ...
表头跳过写成
if [ "$id" = "id" ]; then continue; fi
,别依赖行号,因为可能有空行干扰 字段本身含逗号?
read
会直接劈开,无法恢复——这时已超出 shell 内建能力,该换工具 性能差:每行启动一次子 shell,处理百万行 CSV 明显慢于
awk
什么时候必须放弃 shell,改用专业工具 当 CSV 出现以下任一情况,硬撑只会让脚本越来越难维护: 字段含引号包裹的逗号,例如
"John, Doe",32,"San Francisco"
字段含换行符(合法 CSV 允许引号内换行) 需处理 UTF-8 中文、BOM 头、或混合编码 要验证字段类型(如强制
$3
是整数)、做跨行聚合(如按城市统计平均年龄) 此时应切换到
csvtool
(Debian/Ubuntu 自带)或 Python 的
csv
模块——不是“更高级”,而是它们专为 CSV RFC 4180 设计,shell 工具根本没打算解决这个问题。

相关文章