最近需求中需要使用lucene的分组查询,现有API使用GroupingSearch查询,代码如下:
GroupingSearch groupingSearch = new GroupingSearch("compId");
groupingSearch.setGroupSort(new Sort(SortField.FIELD_SCORE));
groupingSearch.setFillSortFields(true);
//groupingSearch.setCachingInMB(8.0, true);
groupingSearch.setAllGroups(true);
// groupingSearch.setAllGroupHeads(true);
groupingSearch.setGroupDocsLimit(10);
IndexWriterConfig config = new IndexWriterConfig(new IKAnalyzer());
config.setOpenMode(OpenMode.CREATE_OR_APPEND);
LogByteSizeMergePolicy mergePolicy = new LogByteSizeMergePolicy();
Directory directory = NIOFSDirectory.open(new File("/Users/lvyanglin/searchdata/search/offlineindex").toPath()); // 新建的文件在子目录
mergePolicy.setMergeFactor(5);
config.setMergePolicy(mergePolicy);
config.setSimilarity(new ClassicSimilarity());
IndexWriter indexWriter = new IndexWriter(directory, config);
IndexReader reader = DirectoryReader.open(indexWriter);
IndexSearcher isearcher = new IndexSearcher(reader);
Query query = new TermQuery(new Term("id", "20755185"));
TopGroups<BytesRef> result = groupingSearch.search(isearcher, query, 0, 1000);
System.out.println("搜索命中数:" + result.totalHitCount);
System.out.println("搜索结果分组数:" + result.groups.length);
Document document;
for (GroupDocs<BytesRef> groupDocs : result.groups) {
System.out.println("分组:" + groupDocs.groupValue.utf8ToString());
System.out.println("组内记录:" + groupDocs.totalHits);
// System.out.println("groupDocs.scoreDocs.length:" +
// groupDocs.scoreDocs.length);
for (ScoreDoc scoreDoc : groupDocs.scoreDocs) {
System.out.println("compId="+isearcher.doc(scoreDoc.doc).get("compId"));
}
}
}
但是不管怎么调试都会出现:
Exception in thread "main" java.lang.IllegalStateException: unexpected docvalues type NONE for field 'compId' (expected=SORTED). Re-index with correct docvalues type.
at org.apache.lucene.index.DocValues.checkField(DocValues.java:212)
at org.apache.lucene.index.DocValues.getSorted(DocValues.java:264)
at org.apache.lucene.search.grouping.term.TermFirstPassGroupingCollector.doSetNextReader(TermFirstPassGroupingCollector.java:91)
at org.apache.lucene.search.SimpleCollector.getLeafCollector(SimpleCollector.java:33)
at org.apache.lucene.search.MultiCollector.getLeafCollector(MultiCollector.java:121)
at org.apache.lucene.search.IndexSearcher.search(IndexSearcher.java:660)
at org.apache.lucene.search.IndexSearcher.search(IndexSearcher.java:473)
at org.apache.lucene.search.grouping.GroupingSearch.groupByFieldOrFunction(GroupingSearch.java:193)
at org.apache.lucene.search.grouping.GroupingSearch.search(GroupingSearch.java:129)
at com.shunteng.service.test.v3.GroupSearchTest2.main(GroupSearchTest2.java:79)
问题在于分组排序字段必须为SortedDocValuesField,因为是long类型字段所以我就使用SortedNumbericDocValuesField这个字段建索引,运行后还是发生以上错误。百度基本上找个不到问题原因,官网也是没什么解释,官网wiki上也没有例子。只能debug代码来找出问题,看是在那个环节出现的异常。直接抛出异常的方法是DocValues.java中checkField方法,
private static void checkField(LeafReader in, String field, DocValuesType... expected) {
FieldInfo fi = in.getFieldInfos().fieldInfo(field);
if (fi != null) {
DocValuesType actual = fi.getDocValuesType();
throw new IllegalStateException("unexpected docvalues type " + actual +
" for field '" + field + "' " +
(expected.length == 1
? "(expected=" + expected[0]
: "(expected one of " + Arrays.toString(expected)) + "). " +
"Re-index with correct docvalues type.");
}
}
看下面方法进入此方法抛出异常,制药进入上面这个方法必定抛出异常。所以要找出为什么进入这个方法:
public static SortedDocValues getSorted(LeafReader reader, String field) throws IOException {
SortedDocValues dv = reader.getSortedDocValues(field);
if (dv == null) {
checkField(reader, field, DocValuesType.SORTED);
return emptySorted();
} else {
return dv;
}
}
上面这个方法getSorted是关键条件,深入=reader.getSortedDocValues(field);这个方法如下
@Override
@Override
public final SortedDocValues getSortedDocValues(String field) throws IOException {
ensureOpen();
Map<String,Object> dvFields = docValuesLocal.get();
Object previous = dvFields.get(field);
if (previous != null && previous instanceof SortedDocValues) {
return (SortedDocValues) previous;
} else {
FieldInfo fi = getDVField(field, DocValuesType.SORTED);
if (fi == null) {
return null;
}
SortedDocValues dv = getDocValuesReader().getSorted(fi);
dvFields.put(field, dv);
return dv;
}
}
这个previous instanceof SortedDocValues 如果成立 或这个后面类型为SortedDocValuesField 就不会有下面return null,问题就是在于我们配置索引分组字段的时候必须要使用SortedDocValuesField 这个类型的字段。不能使用SortedNumbericDocValuesField,来建索引,这个也是lucene奇葩地方。
我写这个文章目的是总结最近起找问题的心得,在使用阿里巴巴dubbo的时候也遇到到处找不到资料的情况,我们需要一步一步的debug出来问题根源比baidu上更靠谱速度也许更快。
分享到:
相关推荐
我的博客专栏http://blog.csdn.net/wuyinggui10000/article/category/3173543,希望大家关注
lucene的查询语法事例.
Lucene多个group by字段实现,字段个数动态。
Lucene.net分组
lucene.NET 中文分词 高亮 lucene.NET 中文分词 高亮 lucene.NET 中文分词 高亮 lucene.NET 中文分词 高亮
lucene 通过FieldCache 实现分组统计 附完整代码
Lucene3.0之查询处理(1):原理和查询类型 各种Query对象详解
lucene facet查询示例,区间查询多dim查询,key-field-value模型了解
文件包含了lucene的创建、删除、修改、组合条件查询、类似mysql中like、in、or、以及时间范围条件查询
lucene 3.0 API中文帮助,学习的人懂得的
lucene在实际应用过程中存在的问题及解决方式。
lucene-grouping-3.5.0.jar分组统计+分类统计插件 分组统计+分类统计
lucene 做索引查询流程,来自《lucene in action》
lucene表达式查询示例和表达式语法详解
用到的工具 jsoup+spring+struct+DButil+mysql+lucene 可以配置采集网站的图片,包含分组统计,相同数据合并功能,主要是给群内成员来个demo,让大家有个学习的demo 小试牛刀、临时写的,莫吐槽 需要用到mysql...
Lucene创建索引,查询索引的简单使用。
2.MUST和MUST_NOT:表示查询结果中不能包含MUST_NOT所对应得查询子句的检索结果。 3.MUST_NOT和MUST_NOT:无意义,检索无结果。 4.SHOULD与MUST、SHOULD与MUST_NOT: SHOULD与MUST连用时,无意义,结果为MUST子句...
在lucene搜索分页过程中,可以有两种方式 一种是将搜索结果集直接放到session中,但是假如结果集非常大,同时又存在大并发访问的时候,很可能造成服务器的内存不足,而使服务器宕机 还有一种是每次都重新进行搜索,这样...
在Eclipse环境中运用java,Lucene建索引及查询关键字
一步一步跟我学习lucene是对近期做lucene索引的总结,