为了账号安全,请及时绑定邮箱和手机立即绑定

sphinx学习手记还不够十个字吗

标签:
PHP

sphinx增量索引和主索引来实现索引的实时更新

项目中文章的信息内容因为持续有新增,而文章总量的基数又比较大,所以做搜索的时候,用了主索引+增量索引这种方式来实现索引的实时更新。

实现原理:

  1. 新建一张表,记录一下上一次已经创建好索引的最后一条记录的ID
    1. 当索引时,然后从数据库中取出所有ID大于上面那个sphinx中的那个ID的数据, 这些就是新的数据,然后创建一个小的索引文件
    2. 把上边我们创建的增量索引文件合并到主索引文件上去
    3. 把最后一条记录的ID更新到第一步创建的表中

值得注意的两点:

1)当合并索引的时候,只是把增量的索引合并进主索引中,增量索引本身并不会变化,也不会被删除;

2)当重建主索引的时候,增量索引就会被删除;

具体操作实现流程:

  1. 新建一张表,用于存储已经建过索引的最大的doc_id

CREATE TABLE sph_counter (
counter_id int(11) NOT NULL COMMENT '标识不同的数据表',
max_doc_id int(11) NOT NULL COMMENT '每个索引表的最大ID,会实时更新',
PRIMARY KEY (counter_id)
) ENGINE=InnoDB DEFAULT CHARSET=utf8

  1. 配置索引文件

复制代码

主索引数据源定义

source article_main
{
type = mysql
sql_host =xxx.xxx.xxx.xx
sql_user =
sql_pass =
sql_db =

sql_port                = 3306
sql_query_pre           = SET NAMES utf8
sql_query_pre           = REPLACE INTO sph_counter SELECT 1, MAX(id) FROM documents

sql_query_range =
sql_range_step = 10000
sql_query = \
SELECT *\
FROM documents WHERE id>=$start AND id<=$end

sql_attr_timestamp        = pubtime  #从SQL读取到的值必须为整数,作为时间属性

sql_query_info_pre      = SET NAMES utf8                                        #命令行查询时,设置正确的字符集
sql_query_info            = SELECT * FROM documents WHERE id=$id #命令行查询时,从数据库读取原始数据信息

}
复制代码
复制代码

增量索引数据源定义

source article_delta : article_main
{
sql_query_pre = SET NAMES utf8

sql_query_range =
sql_range_step = 10000
sql_query = \
SELECT *\
FROM documents WHERE id>=$start AND id<=$end

sql_attr_timestamp        = pubtime  #从SQL读取到的值必须为整数,作为时间属性
# 增量索引创建完成之后,更新最大的doc_id
sql_query_post  = UPDATE sph_counter  SET max_doc_id=(SELECT MAX(id) FROM documents) where counter_id=1
#                      REPLACE INTO sph_counter SELECT 1, MAX(id) FROM documents

sql_query_info_pre      = SET NAMES utf8                                        #命令行查询时,设置正确的字符集
sql_query_info            = SELECT * FROM article_info WHERE id=$id #命令行查询时,从数据库读取原始数据信息

}
复制代码
复制代码

主索引index定义

index article_main
{
source = article_main #对应的source名称
path = /data/... #请修改为实际使用的绝对路径,例如:/usr/local/coreseek/var/...
docinfo = extern
mlock = 0
morphology = none
min_word_len = 1
html_strip = 0

#中文分词配置,详情请查看:http://www.coreseek.cn/products-install/coreseek_mmseg/
charset_dictpath = /usr/local/mmseg3/etc/ #BSD、Linux环境下设置,/符号结尾
#charset_dictpath = etc/                             #Windows环境下设置,/符号结尾,最好给出绝对路径,例如:C:/usr/local/coreseek/etc/...
charset_type        = zh_cn.utf-8

}

增量索引index定义

index article_delta : article_main
{
source = article_delta
path = /data/....
docinfo = extern
mlock = 0
morphology = none
min_word_len = 1
html_strip = 0

#中文分词配置,详情请查看:http://www.coreseek.cn/products-install/coreseek_mmseg/
charset_dictpath = /usr/local/mmseg3/etc/ #BSD、Linux环境下设置,/符号结尾
#charset_dictpath = etc/                             #Windows环境下设置,/符号结尾,最好给出绝对路径,例如:C:/usr/local/coreseek/etc/...
charset_type        = zh_cn.utf-8

}

点击查看更多内容
1人点赞

若觉得本文不错,就分享一下吧!

评论

作者其他优质文章

正在加载中
感谢您的支持,我会继续努力的~
扫码打赏,你说多少就多少
赞赏金额会直接到老师账户
支付方式
打开微信扫一扫,即可进行扫码打赏哦
今天注册有机会得

100积分直接送

付费专栏免费学

大额优惠券免费领

立即参与 放弃机会
意见反馈 帮助中心 APP下载
官方微信

举报

0/150
提交
取消