深度阅读

文章详情

围绕重点内容进行完整呈现,帮助读者获得更顺畅、更聚焦的阅读体验。

同一大纲下两个检测器的巨大差异
Article View

同一大纲下两个检测器的巨大差异

球盟会.QMH(中国)-官方网站 853 阅读 约 5.5 分钟

同一份大纲的内容,两个检测器却给出了截然不同的结果,差异可达到十几倍。Google DeepMind与多家顶尖实验室合作开发了一种名为IdeaLens的工具,旨在检测“AI生成的创意”。该工具只关注大纲,而不分析具体文字。在一组对比数据中,当AI根据某个人的完整大纲进行创作时,IdeaLens仅将7%标记为由AI生成,而Pangram 4却标记了92%。相反,当50篇故事是由人根据AI生成的大纲写成时,IdeaLens标记了68%,而Pangram 4却只标记了8%。这表明,两款检测器测量的内容本质不同。

Pangram类工具聚焦于“文字的作者”,因此常常错误地将经过AI润色的人类作品标记为AI生成,同时漏掉那些由AI提供创意、人类进行写作的内容。而IdeaLens则注重分析文档所提要点的来源,关注的是构思的来源而非具体的表达方式。为了避免因措辞而导致的偏差,IdeaLens的训练使用了改写后的要点列表,使其只能从“想法本身”寻求线索。

研究的发现表明,通过分析文档的大纲而非字句,可以有效判断这些想法源自人类还是AI。这一结论突显了一个现实问题——原创思考的标准不能仅依赖于那些只评估措辞的检测器,因为这类工具可能会错误标记人类作品并且忽视AI灵感下人类所创作的内容。简而言之,检测的重点从“语言”转向了“结构”,一份文档的整体框架比其具体的表述更能揭示创意的来源。 球盟会

这一创新的检测方法引发了不同的看法。支持者认为,这是检测思路的必要转型。AI已经能够创作出无法轻易分辨的流畅句子,继续在措辞层面进行检测已越来越无效,而转向大纲的检测则能避免这一难题。反对者则提问:既然大纲可以由AI生成,当AI生成大纲后再写作时,这套检测方法是否依然有效?目前的研究仅涵盖了“人写大纲,AI写作”和“AI写大纲,人创作”的两种情境。

我认为,这篇论文的真正价值在于重新定义了问题的实质。人们曾经关注的是“这段文字是否由AI写成”,现在则转向“这个创意是谁提出的”。这种转变使得文本鉴定变成了创意归属的问题。当涉及原创思考的判断时,检测器所阅读的内容直接影响其判断能力。仅依赖字句的检测器无法判断想法的来源。

觉得有用?分享给朋友

让更多人看到这篇内容。

Recommended

推荐阅读