SEO高端独霸手段之创建词库
SEO高端独霸手段之创建词库
1)词库搭建
- 关头词本源
- 经由过程词根饰词(定向)
- 5118长尾词:https://ci.5118.com/1b49a5d8/
- 爱站长尾词 :https://ci.aizhan.com/8d5a94b1/
- 相干搜刮(包含词根的端独段)轮循
- 下拉框(包含词根的)轮循
- 凤巢关头词
- 5118树状筹算图
:https://plan.5118.com/复制
竞争度:凤巢 > 5118&爱站 > 相干搜刮&下拉晃荡性:凤巢&5118&爱站 > 相干搜刮&下拉定向关头词 ,竞争度较除夜
- 经由过程网站饰词(非定向)
- 5118网站词库 :https://www.5118.com/搜刮引擎优化/百度pc/www.1688.com
- 爱站网站词库:https://百度rank.aizhan.com/百度/1688.com/
- 遍历竞争敌手网站地图:
- tag页、霸手专题页…sitemap
- /tag/1/ /tag/2/ /tag/3/
- …跟局限相干 ,创建词库但有没有了了的端独段词根
- 经由过程词根饰词(定向)
- 分类
- 经由过程词根拓展的
- 找出
遴选前提遴选前提,可以作为网站栏目或遴选项
- 找出
搜刮需求有找交换群的霸手,有找新产品的创建词库 ,有问某个产品靠不靠谱的端独段…
- 屈就遴选前提和搜刮需求,批量生成除夜量词复制
{ 存款产品} + 口儿 + 若何样/是霸手真的吗/出口/链接/贴吧.. { 存款圭表类型} + 口儿 + 有哪些/除夜全...
- 找出
- 经由过程网站拓展的
- 过滤出残剩词
- 与本站内容无缺不相干的
- 不契合社会主义中心价值不美不雅不雅不雅不雅不雅不雅的
- 几回的
- 过滤编制
- 与本站内容无缺不相干的最复杂的编制,经由过程搜刮措置 。创建词库每个词,端独段搜刮整站内容,霸手假定没有搜刮下场,创建词库则与本站内容不相干
- 不契合社会主义中心价值不美不雅不雅不雅不雅不雅不雅的端独段射中黑名单
- 几回的删损掉落踪落停止词后 ,再分词后,霸手词项无缺齐截的创建词库 ,保管一个复制
原始词 :北京公积金提取前提北京市公积金提取前提北京公积金的提取前提公积金北京提取前提停止词(stopword.txt) :的 、{ 区域前缀}市...删除停止词 :北京公积金提取前提北京公积金提取前提北京公积金提取前提公积金北京提取前提分词掉落踪掉落踪词项(jieba模块完成分词):[北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][公积金, 北京, 提取, 前提]>>> 四个词的词项无缺齐截,保管一个词>>> 保管:北京公积金提取前提
- 分类
- 词向量http://ai.百度.com/tech/nlp/word_embedding
机械进修:tensorflow
- 经由过程搜刮
- 网站每个栏面前 ,随机抽取几千篇文章问题
- 按序给每个栏方针文章问题,成立索引
- 用拓展词按序往搜刮,每个栏方针题的索引 ,并记实搜刮下场数量
- 将该关头词
,回类到搜刮下场数最除夜的栏面前复制
比如:1)网站有A 、B 、C 、D四个栏目,各抽取5000篇文章,成立4个索引2)拓展关头词a ,按序往搜刮四个栏目文章的索引3)ABCD四个栏方针搜刮下场数 ,按序是 :90、80、56、1094)则拓展关头词a ,回类到栏目D下
- 打标签文章标签:http://ai.百度.com/tech/nlp_apply/topictagger
文章分类:http://ai.百度.com/tech/nlp_apply/doctagger
- 词向量http://ai.百度.com/tech/nlp/word_embedding
- 过滤出残剩词
- 经由过程词根拓展的
2)关头词筹划
复制措置网页 "塞甚么词" 和 "塞若干很多若干良多若干很多若干良多若干很多若干" 的问题
,进一步措置,网页近似性的问题2.1)TF-IDF筹算
复制TF = 某个词在文档中展示的次数 / 文档的长度
关头词: "黑户口儿"方针页
:http://www.pcben.com/news/gonglue/11835.html>>> 词项:['黑户', '口儿']>>> 文档字数 :2104>>> [黑户] 展示次数
:19>>> [口儿] 展示次数 :49TF(黑户) = 19/2014 = 0.009TF(口儿) = 49/2104 = 0.023IDF = log( 搜刮引擎文档总数 / 展示某个词的文档总数 )
PS:log以2为底
复制搜刮引擎文档总数:100000000[黑户]文档总数
:21400000[口儿]文档总数
:36500000IDF(黑户) = log(100000000/21400000) = 2.22IDF(口儿) = log(100000000/36500000) = 1.45[黑户]的次要性是[口儿]的1.5倍>>> 网页多展示[黑户] ,可以进步与[黑户口儿]的相干性TF-IDF(黑户口儿) = TF(黑户)*IDF(黑户) + TF(口儿)*IDF(口儿) = 0.009×2.22 + 0.023×1.45 = 0.052.2)TF-IDF的意义
- 网页不见得内容越多越好 。若筹划欠妥 ,内容越多反而会浓缩TF(keyword)的分值,从而降低这个词与这个网页的相干性
- IDF本质是一个词项的权重,降低文档中高频关头词的权重
。所以网页中,玩命塞无缺的关头词不见得好,但要多塞这个关头词中IDF最高的词项复制
Case:[北京百度区块链工程师酬报]的网页 ,若添加内链模块,以下哪个轨则,对汲引相干性,大年夜大年夜约终局最好? 词项 :北京 、百度、区块链、工程师、酬报 A. 调用北京区域,10个随机职位的酬报链接(降低近似性,甚至降低排名) B. 调用北京区域 ,30个百度职位的酬报链接(比A严重 ,降低近似性,降低排名) C. 调用北京区域,10个区块链工程师的酬报链接(get) D. 调用北京区域,20个区块链工程师的雇用链接(get)
2.3)BM25筹算
TF-IDF存在较着裂缝
,因为SEO可以经由过程 [缩减页面内容量] 和 [堆砌IDF高的词项] 来拉高关头词与网页的相干性
是以如今采取的都是BM25算法,在TF-IDF根本上,添加了3个参数:
- 常量K:用来限制TF值的添加极限,TF值永远在 [0 ~ K+1] 之间
- 参数L:文档长度与平均长度的比值 ,假定文档长度是平均长度的2倍,则L=2
- 常数b :用来端方L对评分的影响有多除夜
Elasticsearch里,K默许1.2,b默许0.75
$\text{ 公式} = 权重(IDF)×相干性 = \sum_{ i=1}^n\text{ IDF}(keyword)\cdot\left[\frac{ TF(keyword)\cdot\left(k+1\right)}{ TF(keyword) + k\cdot\left(1-b+b\cdot\frac{ 往后文档的字数}{ 全数文档库的平均字数}\right)}\right]$
2.4)BM25的意义
- 添加了文档长度对相干性的影响 。文档越短 ,相干性会比用TF筹算的值更低 ,促进经由过程 [缩减页面内容量] 对相干性筹算的烦扰
- 添加了对TF极限值的限制 ,促进经由过程 [堆砌IDF高的词项] 对相干性筹算的影响
- 只是影响罢了 ,[缩减页面内容量] 和 [堆砌IDF高的词项] 仍是有效的 ,寄看标准
- BM25一样感染于title
SEO高端独霸手段之创建词库
1)词库搭建
- 关头词本源
- 经由过程词根饰词(定向)
- 5118长尾词:https://ci.5118.com/1b49a5d8/
- 爱站长尾词 :https://ci.aizhan.com/8d5a94b1/
- 相干搜刮(包含词根的端独段)轮循
- 下拉框(包含词根的)轮循
- 凤巢关头词
- 5118树状筹算图
:https://plan.5118.com/复制
竞争度:凤巢 > 5118&爱站 > 相干搜刮&下拉晃荡性:凤巢&5118&爱站 > 相干搜刮&下拉定向关头词 ,竞争度较除夜
- 经由过程网站饰词(非定向)
- 5118网站词库 :https://www.5118.com/搜刮引擎优化/百度pc/www.1688.com
- 爱站网站词库:https://百度rank.aizhan.com/百度/1688.com/
- 遍历竞争敌手网站地图:
- tag页、霸手专题页…sitemap
- /tag/1/ /tag/2/ /tag/3/
- …跟局限相干 ,创建词库但有没有了了的端独段词根
- 经由过程词根饰词(定向)
- 分类
- 经由过程词根拓展的
- 找出
遴选前提遴选前提,可以作为网站栏目或遴选项
- 找出
搜刮需求有找交换群的霸手,有找新产品的创建词库 ,有问某个产品靠不靠谱的端独段…
- 屈就遴选前提和搜刮需求,批量生成除夜量词复制
{ 存款产品} + 口儿 + 若何样/是霸手真的吗/出口/链接/贴吧.. { 存款圭表类型} + 口儿 + 有哪些/除夜全...
- 找出
- 经由过程网站拓展的
- 过滤出残剩词
- 与本站内容无缺不相干的
- 不契合社会主义中心价值不美不雅不雅不雅不雅不雅不雅的
- 几回的
- 过滤编制
- 与本站内容无缺不相干的最复杂的编制,经由过程搜刮措置 。创建词库每个词,端独段搜刮整站内容,霸手假定没有搜刮下场,创建词库则与本站内容不相干
- 不契合社会主义中心价值不美不雅不雅不雅不雅不雅不雅的端独段射中黑名单
- 几回的删损掉落踪落停止词后 ,再分词后,霸手词项无缺齐截的创建词库 ,保管一个复制
原始词 :北京公积金提取前提北京市公积金提取前提北京公积金的提取前提公积金北京提取前提停止词(stopword.txt) :的 、{ 区域前缀}市...删除停止词 :北京公积金提取前提北京公积金提取前提北京公积金提取前提公积金北京提取前提分词掉落踪掉落踪词项(jieba模块完成分词):[北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][北京, 公积金, 提取, 前提][公积金, 北京, 提取, 前提]>>> 四个词的词项无缺齐截,保管一个词>>> 保管:北京公积金提取前提
- 分类
- 词向量http://ai.百度.com/tech/nlp/word_embedding
机械进修:tensorflow
- 经由过程搜刮
- 网站每个栏面前 ,随机抽取几千篇文章问题
- 按序给每个栏方针文章问题,成立索引
- 用拓展词按序往搜刮,每个栏方针题的索引 ,并记实搜刮下场数量
- 将该关头词
,回类到搜刮下场数最除夜的栏面前复制
比如:1)网站有A 、B 、C 、D四个栏目,各抽取5000篇文章,成立4个索引2)拓展关头词a ,按序往搜刮四个栏目文章的索引3)ABCD四个栏方针搜刮下场数 ,按序是 :90、80、56、1094)则拓展关头词a ,回类到栏目D下
- 打标签文章标签:http://ai.百度.com/tech/nlp_apply/topictagger
文章分类:http://ai.百度.com/tech/nlp_apply/doctagger
- 词向量http://ai.百度.com/tech/nlp/word_embedding
- 过滤出残剩词
- 经由过程词根拓展的
2)关头词筹划
复制措置网页 "塞甚么词" 和 "塞若干很多若干良多若干很多若干良多若干很多若干" 的问题
,进一步措置,网页近似性的问题2.1)TF-IDF筹算
复制TF = 某个词在文档中展示的次数 / 文档的长度
关头词: "黑户口儿"方针页
:http://www.pcben.com/news/gonglue/11835.html>>> 词项:['黑户', '口儿']>>> 文档字数 :2104>>> [黑户] 展示次数
:19>>> [口儿] 展示次数 :49TF(黑户) = 19/2014 = 0.009TF(口儿) = 49/2104 = 0.023IDF = log( 搜刮引擎文档总数 / 展示某个词的文档总数 )
PS:log以2为底
复制搜刮引擎文档总数:100000000[黑户]文档总数
:21400000[口儿]文档总数
:36500000IDF(黑户) = log(100000000/21400000) = 2.22IDF(口儿) = log(100000000/36500000) = 1.45[黑户]的次要性是[口儿]的1.5倍>>> 网页多展示[黑户] ,可以进步与[黑户口儿]的相干性TF-IDF(黑户口儿) = TF(黑户)*IDF(黑户) + TF(口儿)*IDF(口儿) = 0.009×2.22 + 0.023×1.45 = 0.052.2)TF-IDF的意义
- 网页不见得内容越多越好 。若筹划欠妥 ,内容越多反而会浓缩TF(keyword)的分值,从而降低这个词与这个网页的相干性
- IDF本质是一个词项的权重,降低文档中高频关头词的权重
。所以网页中,玩命塞无缺的关头词不见得好,但要多塞这个关头词中IDF最高的词项复制
Case:[北京百度区块链工程师酬报]的网页 ,若添加内链模块,以下哪个轨则,对汲引相干性,大年夜大年夜约终局最好? 词项 :北京 、百度、区块链、工程师、酬报 A. 调用北京区域,10个随机职位的酬报链接(降低近似性,甚至降低排名) B. 调用北京区域 ,30个百度职位的酬报链接(比A严重 ,降低近似性,降低排名) C. 调用北京区域,10个区块链工程师的酬报链接(get) D. 调用北京区域,20个区块链工程师的雇用链接(get)
2.3)BM25筹算
TF-IDF存在较着裂缝
,因为SEO可以经由过程 [缩减页面内容量] 和 [堆砌IDF高的词项] 来拉高关头词与网页的相干性
是以如今采取的都是BM25算法,在TF-IDF根本上,添加了3个参数:
- 常量K:用来限制TF值的添加极限,TF值永远在 [0 ~ K+1] 之间
- 参数L:文档长度与平均长度的比值 ,假定文档长度是平均长度的2倍,则L=2
- 常数b :用来端方L对评分的影响有多除夜
Elasticsearch里,K默许1.2,b默许0.75
$\text{ 公式} = 权重(IDF)×相干性 = \sum_{ i=1}^n\text{ IDF}(keyword)\cdot\left[\frac{ TF(keyword)\cdot\left(k+1\right)}{ TF(keyword) + k\cdot\left(1-b+b\cdot\frac{ 往后文档的字数}{ 全数文档库的平均字数}\right)}\right]$
2.4)BM25的意义
- 添加了文档长度对相干性的影响 。文档越短 ,相干性会比用TF筹算的值更低 ,促进经由过程 [缩减页面内容量] 对相干性筹算的烦扰
- 添加了对TF极限值的限制 ,促进经由过程 [堆砌IDF高的词项] 对相干性筹算的影响
- 只是影响罢了 ,[缩减页面内容量] 和 [堆砌IDF高的词项] 仍是有效的 ,寄看标准
- BM25一样感染于title













