lucene索引文件格式介绍
2010-05-11 20:44
253 查看
每一个索引段文件包含如下的信息:
域名字、对应域包含的值,一组组域名和对应的域值组成了文档,在搜索返回的结果中就是这些域和域对应的值,每个文档会用一个ID与此对应。
term字典,包含了有多少存有term的文档个数,指向term的频率与位置信息。
Term频率数据,对字典中的每一个term,包含term的文档数,以及一个term在一个文档中出现的次数,如果omitTf=false。
Term位置数据,对字典中的每一个term,term在文档中的存在位置,要注意的是,如果在所有文档中的所有field将omitTf设为了true,那么此项不会存在。
规格化因子,对每个文档中的field,在搜索时为搜索结果增加相同的分数。
Term向量,对每个文档中的field,这个向量可以不存储,主要是用来做搜索时高亮显示用的,它包括term的值以及term频率。
删除的文档,表示哪个文档被标记为删除。
lucene索引中的各文件格式简单介绍如下:
英文文档见:http://lucene.apache.org/java/3_0_0/fileformats.html
原文地址: lucene索引文件格式介绍
域名字、对应域包含的值,一组组域名和对应的域值组成了文档,在搜索返回的结果中就是这些域和域对应的值,每个文档会用一个ID与此对应。
term字典,包含了有多少存有term的文档个数,指向term的频率与位置信息。
Term频率数据,对字典中的每一个term,包含term的文档数,以及一个term在一个文档中出现的次数,如果omitTf=false。
Term位置数据,对字典中的每一个term,term在文档中的存在位置,要注意的是,如果在所有文档中的所有field将omitTf设为了true,那么此项不会存在。
规格化因子,对每个文档中的field,在搜索时为搜索结果增加相同的分数。
Term向量,对每个文档中的field,这个向量可以不存储,主要是用来做搜索时高亮显示用的,它包括term的值以及term频率。
删除的文档,表示哪个文档被标记为删除。
lucene索引中的各文件格式简单介绍如下:
索引文件 | 索引文件含义 |
.f(n) | 规格化文件 |
.fdt | 包含各个域数据(field的特性)信息 |
.fdx | 它是指向.fdt文件的指针,填写的是.fdt文件中每个文档的域数据信息的起始位置 |
.fnm | 各个域的名字信息 |
.frq | 词元(term)的频率信息 |
.prx | Term在文档中的位置信息 |
.tis | 包含term数据信息,指向位置文件与频率文件的指针 |
.tii | 是.tis文件的快表,可以快速定位.tis文件中term数据信息 |
.tvd | 保存有document信息,用词元向量(TermVector)方式保存field的信息,同时包含一个指针表,表内的指针指向.tvf文件中的field信息 |
.tvf | 以TermVector方式保存field数据信息 |
.tvx | 是.tvd的索引文件,保存了指向.tvd指针信息 |
deletable | 包含要删除的文档信息 |
Segments_N与segments.gen | 保存了相关段的信息 |
原文地址: lucene索引文件格式介绍
相关文章推荐
- lucene索引文件格式介绍
- Lucene学习总结之三:Lucene的索引文件格式(1)
- Lucene学习笔记(2)::Lucene的索引文件格式
- lucene索引文件格式解析
- lucene索引文件格式
- lucene-索引文件格式
- Lucene学习总结之三:Lucene的索引文件格式(2)
- Lucene学习总结之四:细述Lucene的索引文件格式(1)
- Lucene学习总结之三:Lucene的索引文件格式(2)
- Lucene的索引文件格式
- Lucene的索引文件格式
- Lucene学习总结之三:Lucene的索引文件格式(2)
- lucene索引文件格式
- Lucene学习总结之三:Lucene的索引文件格式(1)
- lucene 索引文件格式
- Lucene学习总结之三:Lucene的索引文件格式(1)
- Lucene学习总结之三:Lucene的索引文件格式(2)
- Lucene文件格式和索引过程分析
- Lucene学习总结之三:Lucene的索引文件格式(3)
- lucene学习资料(索引文件格式详解)