百万文章去重插件更新至2.0
很久之前开发过一个文章去重插件,由于需要生成文章指纹,而生成指纹又依赖分词。
分词的速度是比较慢的,因此去重插件用起来体验不太好。
具体的表现就是发布文章速度比较慢,其实不是寻找重复文章比较慢,而是分词比较慢。
仔细一下,其实生成文章指纹并不需要那么精确的分词。一些简单的分词器就可以,毕竟我们要的指纹而不是分词。
因此2.0版本移除api分词,使用一个简单的本地分词器分词。
这样一来很多非常有用的功能都可以添加啦!一起来看看2.0版本都增加了哪些功能吧!
一、文章后台增加文章指纹
文章指纹是64位的二进制串,我转成字符串展示在后台方便排查问题。当你觉得两个文章非常相似的时候,插件又没有去重,可以联系作者看看文章指纹的差别。
二、文章保存草稿也可以排重
这个功能某个用户催了很久了。由于之前一直用的是API分词,速度太慢。如果每次保存草稿都分词,必定会影响使用体验。
这次改为本地分词,因此这个功能也可以加上了。
还没有下载的朋友可以在这里下载:WordPress文章去重插件simp,支持巨量文章查重
你可能还喜欢下面这些文章
除了手动添加还可以导入关键词,一行一个即可关键词导入界面还可以设置每一篇文章的最多标签数量,如下图:。STEP2、接下来你需要丰富关键词库,可以选择手动添加关键词或者导入关键词。
wprec利用相似度算法计算每篇文章之间的相似度,找到与当前文章最相似的一些文章,展现在文章底部作为相关文章。我们知道,相关推荐插件推荐的原理是根据当前文章的特征(文章的高权重标签),从文章库中召回相关文章,再根据相关性评分,最后选出TopN
什么是高频词大家知道,相关推荐wprec的主要功能是根据当前文章相关度推荐前N篇文章展示在文章底部。比如一篇文章的特征词是:WordPress、插件、推荐、核心、相似、相关、排名、调权、SEO、展示、分类、分词。