文件独特行数指的是文件中不重复的行的数量。统计文件独特行数是一个常见的需求,尤其是在处理日志文件、数据集或文本文件时。
以下是使用 Python 实现统计文件独特行数的方法:
方法 1:使用集合(Set)
集合(Set)是一种无序且不重复的数据结构,非常适合用来统计独特行数。
代码实现
def count_unique_lines(file_path):
unique_lines = set() # 用集合存储独特行
with open(file_path, 'r', encoding='utf-8') as f:
for line in f:
unique_lines.add(line.strip()) # 去除换行符并添加到集合
return len(unique_lines) # 返回独特行数
# 示例调用
file_path = 'example.txt'
unique_count = count_unique_lines(file_path)
print(f"文件 '{file_path}' 中的独特行数为: {unique_count}")
优点
-
代码简洁,易于理解。
-
集合自动去重,无需额外处理。
缺点
-
如果文件非常大,集合可能会占用较多内存。