Apache-Tika解析Excell文档
2015-11-18 19:19
543 查看
通常在使用爬虫时,爬取到网上的文章都是各式各样的格式处理起来比较麻烦,这里我们使用Apache-Tika来处理Excell格式的文章,如下:
package com.mengyao.tika.app; import java.io.File; import java.io.FileInputStream; import org.apache.tika.metadata.Metadata; import org.apache.tika.parser.ParseContext; import org.apache.tika.parser.microsoft.ooxml.OOXMLParser; import org.apache.tika.sax.BodyContentHandler; public class ExcellApp { public static void main(final String[] args) throws Exception { // Tika默认是10*1024*1024,这里防止文件过大导致Tika报错 BodyContentHandler handler = new BodyContentHandler(1024 * 1024 * 10); Metadata metadata = new Metadata(); FileInputStream inputstream = new FileInputStream(new File("D:/报价清单.xlsx")); ParseContext pcontext = new ParseContext(); // 解析Excell文档时应由超类AbstractParser的派生类OOXMLParser实现 OOXMLParser msofficeparser = new OOXMLParser(); msofficeparser.parse(inputstream, handler, metadata, pcontext); // 获取Excell文档的内容 System.out.println("Excell文档内容:" + handler.toString()); // 获取Excell文档的元数据 System.out.println("Excell文档元数据:"); String[] metadataNames = metadata.names(); for (String name : metadataNames) { System.out.println(name + " : " + metadata.get(name)); } } }
相关文章推荐
- ubuntu中安装apache ab命令进行简单压力测试
- 在Ubuntu 14.04 LTS系统中设置Apache虚拟主机
- apache记录真实的访问IP地址
- Apache Camel配置SSL的CXF
- ubuntu apache django 布署
- Apache ab 的简单实用
- Apache服务器访问过慢分析及解决
- Apache运行机制剖析
- CentOS7 初次安装记录(五)配置 apache 虚拟主机
- Android程序通过Apache服务器执行PHP程序连接Mysql数据库(重要!)
- Maven: 'org.apache.maven.artifact.repository.ArtifactRepository' cannot be instantiated
- apache与IIS端口冲突修改和需要使用 SSL 查看该资源”错误
- Apache Commons工具集简介
- Apache Ant简介
- apache的工作模式
- 使用apache CXF和maven开发Web Service
- Apache Stratos探究: Apache Stratos的Mock IaaS模块
- 使用Apache Spark和MySQL打造强大的数据分析
- Apache重启失败name-based shared memory failure
- org.apache.ibatis.reflection.ReflectionException: There is no getter for property named