字符流
小崔打开十六进制编辑器查看
员工.txt:"原来一个'大'字在磁盘上是E5 A4 A7三个字节!难怪用字节流读文本,缓冲区边界切不准就乱码。"
白歌:"正是。字符流在字节流之上加了一层编码/解码器,帮你把字节序列翻译成人类能读的字符。对文本,用字符流比字节流省心得多。"
一、字符流定位
字符流专为文本数据设计。它内部维护一个字符编码器/解码器,在读写时自动完成字符与字节之间的转换。
| 特性 | 字节流 | 字符流 |
|---|---|---|
| 处理单位 | 1 字节(8 bit) | 1 字符(Java中为16 bit Unicode) |
| 适用范围 | 所有文件类型 | 仅文本文件(.txt, .csv, .json, .xml, .java 等) |
| 编码管理 | 程序员自行处理 | 自动处理(内部使用默认或指定编码) |
| 基类 | InputStream / OutputStream | Reader / Writer |
| 节点流类 | FileInputStream / FileOutputStream | FileReader / FileWriter |
二、字符编码深度解析
2.1 从字节到字符的桥梁
字符流最核心的价值在于自动处理编码。不同编码方案对同一个字符的字节表示完全不同:
| 字符 | UTF-8 编码 | GBK 编码 | UTF-16 编码 |
|---|---|---|---|
A | 41 (1字节) | 41 (1字节) | 00 41 (2字节) |
翔 | E7 BF 94 (3字节) | CF E8 (2字节) | 7F D4 (2字节) |
飞 | E9 A3 9E (3字节) | B7 C9 (2字节) | 98 DE (2字节) |
同一个"翔"字,UTF-8 用3个字节,GBK 用2个字节。如果用错了编码,就会出现经典的乱码现象。
2.2 JDK 8 默认编码
JDK 8 的默认字符编码取决于操作系统和JVM设置:
| 操作系统 | 默认编码 |
|---|---|
| Windows(中文) | GBK(或GB2312) |
| macOS / Linux(中文) | UTF-8 |
重要提示:跨平台项目必须显式指定编码,绝不能依赖平台默认值。否则Windows开发的代码放到Linux服务器就可能乱码。
2.3 编码转换流程
三、FileReader / FileWriter 核心方法
3.1 FileReader
// FileReader 本质上是 InputStreamReader 的子类
// 它使用平台默认编码(JDK 8中无法自定义编码!)
public class FileReader extends InputStreamReader {
public FileReader(String fileName) throws FileNotFoundException { ... }
public FileReader(File file) throws FileNotFoundException { ... }
// 没有接受 Charset 参数的构造方法!
}
JDK 8 限制:
FileReader不能指定编码!这在跨平台开发中是严重问题。解决方案:使用new InputStreamReader(new FileInputStream(file), "UTF-8")替代。
3.2 FileWriter
| 构造方法 | 说明 |
|---|---|
FileWriter(String fileName) | 覆盖模式 |
FileWriter(String fileName, boolean append) | append=true 追加模式 |
FileWriter(File file) | 覆盖模式 |
FileWriter(File file, boolean append) | 追加模式 |
FileWriter同样不能指定编码,同样的限制。
3.3 核心读写方法
| 方法 | 所属类 | 说明 |
|---|---|---|
int read() | Reader | 读取单个字符,返回0~65535,-1表示结束 |
int read(char[] cbuf) | Reader | 读取字符到数组,返回实际读取数 |
int read(char[] cbuf, int off, int len) | Reader | 带偏移和长度的读取 |
void write(int c) | Writer | 写出单个字符(int的低16位) |
void write(char[] cbuf) | Writer | 写出整个字符数组 |
void write(String str) | Writer | 写出字符串(字节流没有此方法) |
void write(String str, int off, int len) | Writer | 写出字符串的一部分 |
Writer append(CharSequence csq) | Writer | 追加字符序列(返回this,支持链式调用) |
void flush() | Writer | 强制将内部缓冲写出 |
void close() | Writer | 关闭流(内部自动调用flush) |
四、完整示例:飞翔科技配置文件管理
场景描述
飞翔科技运营部使用 server.conf 管理服务器配置。小崔需要编写一个工具类读取和保存配置。
示例一:用字符流读取配置文件(指定UTF-8编码)
import java.io.*;
import java.util.Properties;
/**
* 飞翔科技 - 服务器配置读取工具
* 使用 InputStreamReader 显式指定 UTF-8 编码读取中文配置
*/
public class ConfigReader {
public static void main(String[] args) {
String configPath = "C:/feixiang/config/server.conf";
// ✅ 使用 InputStreamReader 显式指定 UTF-8 编码
try (Reader reader = new InputStreamReader(
new FileInputStream(configPath), "UTF-8");
BufferedReader br = new BufferedReader(reader)) {
Properties props = new Properties();
props.load(br);
System.out.println("=== 飞翔科技服务器配置 ===");
System.out.println("数据库主机:" + props.getProperty("db.host"));
System.out.println("数据库端口:" + props.getProperty("db.port"));
System.out.println("管理员姓名:" + props.getProperty("admin.name"));
System.out.println("日志路径:" + props.getProperty("log.path"));
System.out.println("公司名称:" + props.getProperty("company.name"));
} catch (IOException e) {
System.err.println("配置文件读取失败:" + e.getMessage());
}
}
}
假设 server.conf 内容:
db.host=192.168.1.100
db.port=3306
admin.name=大翔
log.path=/var/log/feixiang/
company.name=飞翔科技
运行输出:
=== 飞翔科技服务器配置 ===
数据库主机:192.168.1.100
数据库端口:3306
管理员姓名:大翔
日志路径:/var/log/feixiang/
公司名称:飞翔科技
示例二:用字符流写入带中文的日志文件
import java.io.*;
import java.time.LocalDateTime;
import java.time.format.DateTimeFormatter;
/**
* 飞翔科技 - 系统日志写入工具
* 使用 OutputStreamWriter 指定 UTF-8 编码,安全写入中文日志
*/
public class LogWriter {
private static final String LOG_PATH = "C:/feixiang/logs/system.log";
private static final DateTimeFormatter DTF =
DateTimeFormatter.ofPattern("yyyy-MM-dd HH:mm:ss");
public static void main(String[] args) {
// 写入几条日志
writeLog("INFO", "系统启动完成 - 初始化模块数:12");
writeLog("WARN", "磁盘使用率达到 85%,请关注");
writeLog("INFO", "管理员【大翔】登录后台系统");
writeLog("ERROR", "数据库连接超时 - 主机:192.168.1.200:3306");
System.out.println("日志写入完成,开始回读验证:\n");
readLastLogs(10);
}
/** 追加日志到文件(UTF-8编码) */
public static void writeLog(String level, String message) {
// ✅ 使用 OutputStreamWriter 显式指定 UTF-8 编码
try (Writer writer = new OutputStreamWriter(
new FileOutputStream(LOG_PATH, true), "UTF-8");
BufferedWriter bw = new BufferedWriter(writer)) {
String timestamp = LocalDateTime.now().format(DTF);
bw.write(String.format("[%s] [%-5s] %s", timestamp, level, message));
bw.newLine();
bw.flush(); // 确保每条日志立即写入磁盘
} catch (IOException e) {
System.err.println("日志写入失败:" + e.getMessage());
}
}
/** 读取最近N条日志 */
public static void readLastLogs(int lines) {
try (BufferedReader br = new BufferedReader(
new InputStreamReader(
new FileInputStream(LOG_PATH), "UTF-8"))) {
String line;
int count = 0;
while ((line = br.readLine()) != null) {
System.out.println(line);
if (++count >= lines) break;
}
} catch (IOException e) {
System.err.println("日志读取失败:" + e.getMessage());
}
}
}
运行输出:
日志写入完成,开始回读验证:
[2025-01-15 09:30:12] [INFO ] 系统启动完成 - 初始化模块数:12
[2025-01-15 09:30:12] [WARN ] 磁盘使用率达到 85%,请关注
[2025-01-15 09:30:13] [INFO ] 管理员【大翔】登录后台系统
[2025-01-15 09:30:13] [ERROR] 数据库连接超时 - 主机:192.168.1.200:3306
五、字符流的内部缓冲
你可能注意到上面的代码使用了 BufferedWriter,但即使不使用,FileWriter 和 OutputStreamWriter 本身也有内部缓冲区。
关键:字符流有两层缓冲——Writer自己的char缓冲区 和 底层StreamEncoder的byte缓冲区。这就是为什么数据写出后可能没有立即出现在磁盘上,必须调用
flush()或close()才能确保落盘。
六、字节流 vs 字符流:本质区别
| 比较点 | 字节流 | 字符流 |
|---|---|---|
| 中文处理 | 需自行处理编码,容易乱码 | 自动编解码(需指定正确编码) |
| 二进制文件 | 可以 | 不可以(会破坏数据) |
| 性能 | 无编码开销,更快 | 有编解码开销 |
| API便利性 | 无 write(String) | 有 write(String)、readLine() |
七、易错场景
反例一:用 FileReader 读取跨平台文件导致乱码
// ❌ 错误:FileReader 使用平台默认编码(Windows=GBK, Linux=UTF-8)
// 如果在 Windows 上开发,读取 Linux 服务器生成的 UTF-8 文件必乱码
try (FileReader fr = new FileReader("server_data.txt")) {
char[] buf = new char[1024];
int len = fr.read(buf);
System.out.println(new String(buf, 0, len)); // 乱码!
}
纠正:
// ✅ 正确:使用 InputStreamReader 显式指定 UTF-8
try (Reader reader = new InputStreamReader(
new FileInputStream("server_data.txt"), StandardCharsets.UTF_8)) {
char[] buf = new char[1024];
int len = reader.read(buf);
System.out.println(new String(buf, 0, len)); // 正确显示中文
}
反例二:用字符流处理图片文件
// ❌ 错误:字符流试图读取图片,会破坏二进制数据
// FileReader会将字节按编码解码,二进制数据的字节序列被错误解释
try (FileReader fr = new FileReader("employee_photo.jpg")) {
// 即使编译通过,读出的数据也已经损坏
}
纠正:二进制文件必须用字节流。
反例三:写入后忘记 flush() 导致日志丢失
// ❌ 错误:服务崩溃时,缓冲区中的日志数据丢失
Writer writer = new FileWriter("app.log", true);
writer.write("服务启动\n");
writer.write("处理请求\n");
// 没有 flush() —— 如果此时服务异常退出,日志丢失!
纠正:
// ✅ 正确:关键日志每条立即 flush
Writer writer = new FileWriter("app.log", true);
writer.write("服务启动\n");
writer.flush(); // 确保写入磁盘
// 或者使用 try-with-resources,close() 会自动 flush
八、面试考点
Q1:FileReader 和 FileWriter 有什么致命缺陷?
它们不能指定字符编码,强制使用JVM平台默认编码(Windows=GBK,Linux=UTF-8),导致跨平台时极易产生乱码。JDK 8 中推荐使用
new InputStreamReader(new FileInputStream(file), "UTF-8")和new OutputStreamWriter(new FileOutputStream(file), "UTF-8")代替。
Q2:字符流能处理二进制文件吗?为什么?
不能。字符流在读取时会将字节按某种编码解码为Unicode字符,二进制文件的字节序列并非有效的编码字符序列,解码过程会破坏原始数据。例如,图片文件的前几个字节
FF D8 FF E0在UTF-8解码下不是合法字符。
Q3:为什么 Writer 要区分 flush() 和 close()?
flush()只将缓冲区数据强制写出到目标设备,但流仍然可用,可以继续写入。close()在flush()之后还释放了底层资源(文件句柄、Socket连接等),调用close()后流不可再用。对于需要持续写入的日志文件,应定期flush()但不要close()。
Q4:Java 中一个 char 占几个字节?为什么能表示中文?
Java 的
char固定占 2字节(16位),采用UTF-16编码。基本多语言平面(BMP)的字符(包括汉字)都可以用单个char表示。辅助平面字符(如某些emoji)需要两个char(代理对)。而磁盘存储时,具体占几个字节取决于使用的编码方案(UTF-8/GBK等),与内存中的char不同。
Q5:为什么说"字符流 = 字节流 + 编码器"?
字符流底层通过
StreamDecoder/StreamEncoder包装了一个字节流。InputStreamReader持有StreamDecoder,后者持有InputStream。读取时:字节流读入原始字节 → 解码器按指定编码将字节转换为Unicode字符。写出时反向操作。本质上字符流是对字节流的一层编码装饰。
白歌:"字符流解决了文本编码问题,但每次read()/write()都触发系统调用,性能上有优化空间。下一节,我们用缓冲流给它们加个'缓存层'。"