优化百度搜索下拉框❝64xl.com霸屏下拉词❞B站PC下拉

2024-08-12
来源:网络整理

下拉神器是一款专业的下拉词平台,提供各种下拉功能:百度下拉丶360搜索下拉丶必应搜索下拉丶哔哩哔哩下拉丶抖音下拉等等,里面还有批量做词教程技术,可以一次性做10-50个词,省心高效!批量做词,批量出词,可以实现霸屏效果   

有的客户想删除下拉,但是百度不受理,就可以使用批量做词霸屏技术,实现把那些负面信息顶下去,顶掉的效果=删除效果!欢迎您前来使用!新手不懂使用,请多看2遍视频教程哦!下拉神器100%有效果的!   

给大家看一个下拉神器介绍的视频,看完后,点击下面的按钮进入”下拉神器“     

欢迎使用下拉神器,下拉行业老品牌,如果下拉神器都不好使,整个行业其他平台一样不好使,但是大家一定要多学习多看教程,先学会做词出词的技巧!

    




下一篇文章内容预览:


1.文本关键词提取的前世今生

文章的表征有不同层次,从粗到细可以分为类型(分类)、事件(主题)、代表词(关键词)等。关键词是文章表征的重要组成部分。文本的关键词可以认为是“浓缩”了整篇文章的主旨和精髓,是一篇文章的高度概括的自然语言表征。更精准的文本关键词可以为后续的推荐系统带来更精准的文本内容特征,召回更高质量的同类型文章;同时,高质量的关键词也可以作为分类标签直接用于内容运营和用户推荐,提高编辑、运营同事的工作效率。

从文本中提取关键词的问题受到了大量研究者的关注,从最简单的TF-IDF方法计算词权重,到LDA等无监督方法,再到目前广泛使用的神经网络模型,在关键词提取领域有诸多的实践和探索。

2. 游戏文本关键词抽取概述

在公司内部的电竞和游戏中心等综合游戏产品中,存在着大量不同类型的游戏文字,如游戏攻略、新手引导、升级指南等,如何给合适的游戏文字打上正确的关键词标签,并将内容推送给合适的用户,成为了一个重要的课题。

在我们对游戏文本关键词提取的探索中,我们尝试了基于图的无监督方法和基于监督神经网络的方法,并对两种方法的性能做了初步比较。

基于神经网络的有监督方法通常需要一定量的标注数据才能学习到更好的参数。为了满足神经网络训练的需求,结合项目和数据的实际情况,我们在手Q平台的游戏中心收集了约3万条已分类标注的游戏文本,经过相似文本去重和低质量文本过滤后最终获得数据样本。此语料的文本长度从几百字到千余字不等,每个样本有3到6个人工标注的关键词,共计约9万对;语料包含了新手引导、晋级指南、游戏介绍等不同内容的文本,涵盖了王者荣耀、天天玄斗、全民斗战神、天天快跑等热门游戏。实验将3万多篇文本随机分成条训练集、2000条验证集、2000条测试集;在预处理过程中,利用工具对文本进行分词,并在分词前导入游戏词汇相关词典,提高分词的准确率。

3. 从两类文本中提取关键词的模型

1. 基于游戏文本关键词提取方法

该算法的思想直接借鉴了网页排名算法,利用K长度窗口内的词语相邻关系来表示PR算法中的链接指向关系,与迭代公式完全一致,即

。在,

是 i 的重要性权重,

是指向该单词的一组单词,

是指向该单词的单词集合,公式通过迭代完成计算,最终将每个单词的重要性权重进行倒序排序,得到单词重要性排序。

基于的方法简单有效,速度也在可以接受的范围内。但是,该方法有两个明显的缺点:

1. 关键词来源有限,仅为本文档中所有单词的集合,难以学习更多的关键词表征。

也不可能以“生成”的方式获取文章的抽象关键词表达。

2.虽然它考虑了给定距离窗口内关键词共现等信息,但是实际上它还是倾向于给予高频词更高的权重,因此在实际使用中与TF-IDF等方法相比并不具备太大的优势。

思路简单关键词提取工具,容易实现,在各种NLP工具包中都有可以直接调用的模块,比如基于的,基于Java的等等。

2. 背景

该模型自提出以来,已广泛应用于神经机器翻译、图像文本描述生成、文本摘要等领域。关键词提取是文本摘要任务的延续,学者们利用各种神经网络模型在该任务中做出了各种尝试。

该模型通常被称为-,其中二者分别对应()和()部分,通常由普通的RNN单元,或者LSTM单元和GRU单元组成,基于CNN或者其他网络结构的不在本文讨论范围,典型模型如下图1所示。

图1-模型示意图

图1中,下框为模型的编码器。

为源序列的输入,对应关键词抽取中的源文本;上框为模型的解码器,

是解码器的输出,对应于关键词的输出。以关键词提取为例,每个时间步的输出向量y会与a相连,计算词汇表中每个单词的概率(由于语料库词汇量较大,计算每个单词通常存在计算复杂度较高的问题,很多学者提出了改进方案来解决这个问题,如)。

关键词提取工具_提取词关键工具在哪_提取关键词语专题训练

从上图的框架可以看出,

,即每个时间步计算的隐藏层向量

前一个隐藏层的输出

以及当前时间步长输入

部分接受的输入向量c(图1)来自部分输出向量,一般是最后一个时间步的隐藏层输出。

,在某些工作中,它也可能是几个隐藏层向量或函数变换的组合,即

隐层状态向量的计算方法为

即隐藏层的每个时间步

,都使用相同长度的同一个c来计算部分输出向量

的计算也依赖于相同的信息,如图1所示,仍然是相同的c。

从上面的讨论中我们可以看出,一般来说,在文本摘要、机器翻译等任务中,从源文本接收到的输入信息中,有一部分仅仅是一个定长向量c(即使输入文本很长)。将一个定长向量解码成翻译或者关键词摘要信息通常会导致很大的性能损失。2014年提出的机制可以很好地解决这个问题,并在随后的两三年中被广泛应用于翻译、摘要、关键词提取、图像文本生成甚至情感分析中。

基于机制的模型的编码部分和传统模型是一样的,机制的重点主要在 部分,如图2所示,图的下半部分是 部分。当然从图中看,相比于图1,多了一个双向RNN部分,这样做的原因是为了让网络能够一起学习两个方向的信息,与 无关。

图 2 带机制的模型

和普通模型类似,图2中的模型也是从中读取c,但是这个c并不是简单地将最后一个隐藏层节点的值经过函数变换得到,而是通过读取每个时间步的隐藏层节点状态,进行加权求和得到,如下公式所示。

结合公式和图2,可以清楚的看出

在相应的时刻 t,从编码器

每一时刻输入的权重可以通过线性加权求和得到:

,即在时刻t被接受的向量部分。如图2所示,该部分的隐层状态向量为

关键词提取工具_提取词关键工具在哪_提取关键词语专题训练

计算方法是

公式

,通过训练语料库获得,并使用归一化公式将解码器从不同的

重量

总和返回为 1。

2.基于机制的模型

上述模型在机器翻译、智能问答、文本摘要等诸多任务中得到了广泛的应用,但对于文本摘要、关键词提取、智能问答等任务,部分设计仍然存在一些不足。

以关键词提取为例,解码器在每个时间步生成一个单词,这个单词是经过计算的,单词的来源是一个大小为 n 的单词列表。

从计算时间成本的角度考虑,这个词汇表通常不会包含训练集中所有的词,训练集中大量的低频词只能统一被UNK取代;另一方面,测试集中的词可能根本没有在训练集中出现过,当然也可能不在可预测词汇V的范围内。这就带来了一个问题——在文本摘要和关键词提取中常说的OOV(out of)问题。由于这种OOV现象,当新的测试语料库中包含一些重要的词汇表​​外(OOV)词时,那么无论是提取关键词还是生成摘要,这些重要的OOV词都只能被预测为UNK。

说完了OOV问题给模型带来的弊端,我们再来说说机制。如果让一个人做文档摘要或者关键词抽取,他不仅会利用自己的背景知识和过去所学的东西来写这篇摘要,还会从原文中“复制”或者“摘录”一些重要的文字。而我们对比机器的摘要(关键词抽取)工作,传统模型往往只利用在训练语料中学到的参数,在生成时一一预测词汇表中的哪个词应该被选为某个位置;如果原文中几个重要的关键词不在词汇表中,那么很遗憾,这些词根本就没有机会在关键词列表中生成。顾等人借用了人类“复制”和“抄袭”的形式,在with模型中引入了机制,大大改善了OOV问题对关键词抽取和摘要工作的影响。这个网络模型也有一部分是传统形式,没有改变;但在解码器部分,增加了很多关于机制的计算,如图3所示。

图 3 带机制的模型

从图3可以看出,部分模型有隐藏层状态向量

更新和

的预测与之前的模型有显著的不同。如图3右下角所示,的过程可以清晰地分为几个部分:第一部分是左边的实心蓝色箭头,这是来自read的信息,也就是我们通常所说的信息

;第二部分是

第三部分也与上一节相同;

的信息不仅仅是上一个时间步的输出结果,还连接了一个读向量,这个向量其实是用类似注意力机制的方式计算的, 计算每个时间步上与 隐层状态位置相关的信息,为下一个 Copy-Mode 提供信息。

图3右上角的-Mode和Copy-Mode是生成关键词文本的两个概率计算公式。左侧的-Mode生成方式与经典模型相同;而Copy-Mode计算的是从源序列中生成每个单词的概率,两个概率之和为

提取词关键工具在哪_提取关键词语专题训练_关键词提取工具

目标词在该位置的概率如公式所示。

注意公式中的g和c代表两种生成方法,g和c的计算方法与生成的单词相同。

这和V、X两个词汇(源文的词汇)的关系有关,原文中已经描述得很清楚了,这里就不再赘述了。

4. 机制模型对游戏文本关键词提取的意义

从上面的描述我们可以知道,如果一段文本中的重要关键词不是整个训练集中的高频词,也不在词汇表中,那么该机制通过直接从原文中“复制”可以更好地解决这个问题,这是传统方法无能为力的情况。同时,作为经典的生成模型,与其他方法相比,它增加了大量从成千上万的训练语料中学习到的知识,可以很好地平衡“抽取”和“生成”两个模型的优势。

我们以一个简单的例子来结束本文。

《英雄联盟》5V5王者峡谷三路推塔激情对决《英雄联盟》中,5v5对战受到众多玩家的喜爱,玩家可以自行匹配,也可以邀请好友一起对战。5v5对战,单凭一己之力不足以掌控全场,更需要团队间的默契配合。合理的阵容搭配、战场分工明确、玩家对英雄的操作技巧……(节选)

:5v5王者峡谷;英雄联盟;新手

和 (Top5)

(前5名)

1. 国王学院

英雄

2.英雄联盟

2.敌人

3. 5v5 王者峡谷

3. 杀死

4. 新手

4. 队友

5. 5v5英雄联盟

5. 发展

1. 国王学院英雄 2. 国王联盟

2.敌人

3. 5v5 王者峡谷

3. 杀死

4. 新手

4. 队友

5. 5v5英雄联盟

5. 发展

经过在测试集上的测试可以看出,基于DNN的方法在P1@5上提高了4%,在R1@5上提高了8%,在F1@5上提高了5.4%,初步证明了该方法的有效性。

接下来我们还需要从数据和模型两个层面进一步提升关键词抽取的性能,也可以考虑从多模型结果的角度来增加结果的鲁棒性。

原文刊登于微信公众号-腾讯文曲星()

分享