Java中utf-8占几个字节
2016-07-16 10:28
555 查看
占2个字节的:〇
占3个字节的:基本等同于GBK,含21000多个汉字
占4个字节的:中日韩超大字符集里面的汉字,有5万多个
一个utf8数字占1个字节
一个utf8英文字母占1个字节
在查找 UTF-8 编码资料时发现,很多的帖子说的 UTF-8 编码里,一个汉字占用3个字节,有的还做了个证明
方法1:创建一个没有BOM的UTF-8编码的文本文件,里面保存了几个汉字,然后查看文件的大小。我觉得这样的证明没有一点说服力,因为 UTF-8 是变长的,1-6个字节,少量的汉字检测是不能说明所有的汉字都是的。
方法2:
后来我又查看了字符映射表-汉语,找到了正确的答案,少数是汉字每个占用3个字节,多数占用4个字节。
占用3个字节的范围
合计: 52156 个
占用4个字节的范围
合计: 64029 个
参考:http://www.ibm.com/developerworks/cn/java/j-lo-chinesecoding/
占3个字节的:基本等同于GBK,含21000多个汉字
占4个字节的:中日韩超大字符集里面的汉字,有5万多个
一个utf8数字占1个字节
一个utf8英文字母占1个字节
在查找 UTF-8 编码资料时发现,很多的帖子说的 UTF-8 编码里,一个汉字占用3个字节,有的还做了个证明
方法1:创建一个没有BOM的UTF-8编码的文本文件,里面保存了几个汉字,然后查看文件的大小。我觉得这样的证明没有一点说服力,因为 UTF-8 是变长的,1-6个字节,少量的汉字检测是不能说明所有的汉字都是的。
方法2:
String s = "中国"; byte[] bs = s.getBytes("UTF-8"); System.out.println(bs.length);
后来我又查看了字符映射表-汉语,找到了正确的答案,少数是汉字每个占用3个字节,多数占用4个字节。
占用3个字节的范围
U+2E80 - U+2EF3 : 0xE2 0xBA 0x80 - 0xE2 0xBB 0xB3 共 115 个 U+2F00 - U+2FD5 : 0xE2 0xBC 0x80 - 0xE2 0xBF 0x95 共 213 个 U+3005 - U+3029 : 0xE3 0x80 0x85 - 0xE3 0x80 0xA9 共 36 个 U+3038 - U+4DB5 : 0xE3 0x80 0xB8 - 0xE4 0xB6 0xB5 共 7549 个 U+4E00 - U+FA6A : 0xE4 0xB8 0x80 - 0xEF 0xA9 0xAA 共 44138 个 U+FA70 - U+FAD9 : 0xEF 0xA9 0xB0 - 0xEF 0xAB 0x99 共 105 个
合计: 52156 个
占用4个字节的范围
U+20000 - U+2FA1D : 0xF0 0xA0 0x80 0x80 - 0xF0 0xAF 0xA8 0x9D 共 64029 个
合计: 64029 个
参考:http://www.ibm.com/developerworks/cn/java/j-lo-chinesecoding/
相关文章推荐
- java构造方法
- java多线程基本概念与简单实用
- Java中自定义异常的使用
- eclipse快捷键
- JavaWEB小知识学习--原生AJAX
- 深入理解Java虚拟机--运行时栈帧结构
- selenium测试(Java)--多窗口切换(十三)
- Java容器小结和使用示例
- Java计时器Timer和TimerTask用法
- Spring Boot实战之Filter实现使用JWT进行接口认证
- Java容器类型使用总结
- java gc小结
- 001——在myeclipse中添加user library
- 用eclipse加载别人的工程,报错Target runtime com.genuitec.runtime.generic.jee60 is not defined
- spring quartz 定时任务
- 解决MyEclipse 2015 stable1.0 破解失败,INTEGRITY VHECK ERROR的错误
- 解决MyEclipse 2015 stable1.0 破解失败,INTEGRITY VHECK ERROR的错误
- 深入理解JAVA I/O系列二:字节流详解
- spring单例和多例详解。如何在单例中调用多例对象
- javamail 发送附件