关灯
护眼
字体:大 中 小
上一页
目录
下一章
橙红色开始分析,逐渐摸清了规律。
主要是三个问题。
最多的是纯垃圾没有清干净。菠菜广告、瑟瑟引流、关键词堆砌,这些最低级的垃圾,现有的规则只做了关键词匹配,但变体太多了。
用谐音字、用eji替代、把敏感词拆成两段分别塞进前后文里,简单的正则表达式根本防不住。视界里这类数据发着最亮的橙红色,数量不少。
然后是语义重复。两段话用词完全不同,但表达的意思几乎一样,基于关键词和格式的规则识别不了。
最后一个最隐蔽,是低质量内容的伪装。有些内容的格式、长度、关键词分布都符合优质内容的特征,但实际上是洗稿或者机器生成的填充物,里面的内容好多有事实性错误。
这三个加在一起,占了所有数据的将近七成。
韩路一退出视界,开始改脚本。
用传统的垃圾分类规则,想要全涵盖工程量很大,韩路一直接换了个思路。
汤圆的模型不是还在吗,直接把数据发给汤圆做个检测,意图识别。别管你是怎么变体、怎么拆字、怎么用eji,只要最后是“引导点击”或者“诱导付费”的内容,一律会被标出来。
同样的,用汤圆给数据做精简化处理,再合并就简单多了。
最后一个识别伪装内容稍微难了一点,但是难不倒视界,在视界的提示下,韩路一加了一层基于困惑度的筛选。
真正有信息量的文本,语言模型预测下一个词的不确定性会更高;而那些洗稿和填充内容,因为套路化严重,困惑度反而很低。
改完之后重新跑了一遍。
再用视界看过去。
『加入书签,方便阅读』
上一页
目录
下一章