返回第137节  首富从AI浪潮开始首页

关灯 护眼     字体:

上一页 目录 下一章

橙红色开始分析,逐渐摸清了规律。

    主要是三个问题。

    最多的是纯垃圾没有清干净。菠菜广告、瑟瑟引流、关键词堆砌,这些最低级的垃圾,现有的规则只做了关键词匹配,但变体太多了。

    用谐音字、用eji替代、把敏感词拆成两段分别塞进前后文里,简单的正则表达式根本防不住。视界里这类数据发着最亮的橙红色,数量不少。

    然后是语义重复。两段话用词完全不同,但表达的意思几乎一样,基于关键词和格式的规则识别不了。

    最后一个最隐蔽,是低质量内容的伪装。有些内容的格式、长度、关键词分布都符合优质内容的特征,但实际上是洗稿或者机器生成的填充物,里面的内容好多有事实性错误。

    这三个加在一起,占了所有数据的将近七成。

    韩路一退出视界,开始改脚本。

    用传统的垃圾分类规则,想要全涵盖工程量很大,韩路一直接换了个思路。

    汤圆的模型不是还在吗,直接把数据发给汤圆做个检测,意图识别。别管你是怎么变体、怎么拆字、怎么用eji,只要最后是“引导点击”或者“诱导付费”的内容,一律会被标出来。

    同样的,用汤圆给数据做精简化处理,再合并就简单多了。

    最后一个识别伪装内容稍微难了一点,但是难不倒视界,在视界的提示下,韩路一加了一层基于困惑度的筛选。

    真正有信息量的文本,语言模型预测下一个词的不确定性会更高;而那些洗稿和填充内容,因为套路化严重,困惑度反而很低。

    改完之后重新跑了一遍。

    再用视界看过去。

    

『加入书签,方便阅读』

上一页 目录 下一章