Apache Tika 1.27 已发布,Tika 是一个内容抽取的工具集合 (a toolkit for text extracting)。它集成了 POI 和 Pdfbox,并且为文本抽取工作提供了一个统一的界面。其次,Tika 也提供了便利的扩展 API,用来丰富其对第三方文件格式的支持。 主要更新内容: 将 MP4 解析迁移到 Drew Noakes 的元数据提取器上 (TIKA-3459) ... Apache Tika 1.27 发布,内容抽取工具集合下载地址