[[iftgs -版式]]
[[iftags]]
[[/iftags]][[/iftgs]]
[[iftgs -版式]]
[[iftags]]
[[/iftags]][[/iftgs]]
[[iftgs -版式]]
[[iftags]]
[[/iftags]][[/iftgs]]
[[iftgs -版式]]
[[iftags]]
[[/iftags]]
[[/iftgs]]
[[iftgs -版式]]
[[iftags]]
[[/iftags]][[/iftgs]]
哦,所以呢,意义又是什么呢?
如果把你在学校写的那种议论抛掉,把那些就专为了发上期刊、发上报纸的社论抛掉,去统计那些人们真正表达自己观点的杂谈与文段,可能会发现,其实这些文体中,有一部分篇幅,不小且不可忽略的一部分篇幅,并非用于证明自己的观点,而是用于对自己的讨论进行讨论。这些部分,我们暂且就称之为元meta讨论吧。它们在短论文里头以总结或结语出现,在杂谈视频中以“我说这个其实是……”“其实也不是想……”的形式出现,等等还可列举。
你可以将我上一段的发电称为元元讨论,然后把上一分句称为元元元讨论,然后根据数学归纳法你就财富自由了,毕竟有那么多元了。罢了感觉没有人懂我的幽默,我摆这一段的目的也不过是提一嘴,我的文章也不免如此。所以正式进入对本文的元讨论环节……
不知道自何时以来,我们站上出现了“一眼AI”的原创文章。虽然这其中,大部分文章都是遭到神风待遇,被秒删,但也确实有部分一开始冲击到正分然后再删除。同时,对于AI原创文的非正式讨论从一开始就没有断过,几乎成为某些创作交流群组里除神风除评文除烂梗以外的四大月经话题之一。而且,有某段时间站上AI氛围之多,使得我自己开始对井绳哈气,等等。
我想,接下来这一点应该是没有多少异议的:使用AI模型创作文本(注意是创作,改语法等并不涉及真正的创作)的文章,其原创性极低。我们站点在内容政策中禁止了使用AI模型的直接创作,除版权争议外,我猜其最大的原因就是如此吧。我个人当然反对AI直接创作,然而,对于站内之前出现的许多具争议文章,我们并没有直接掌握作者使用了AI直接创作的证据。这使得我们的现状就是,只能由评分者以手里的downvote来对AI文表达反对。
我开始想着我能否总结一下AI文的明显特征,以作为某些方面的参考。当然,我知道这不免受到我自己的批评:“哎呀你这个文,看到且看懂的人自己也能辨别出来,看不懂的你也拿他没办法”等等……不过我还是决定去做。
当然了,我无法保证这篇议论中的任何一个论断,能够确保证明一个作者在创作中使用了AI,除了非常非常明显的那批(例:“如果你需要的话,我可以对生成的层级文章进行进一步的细化修改……”)。而这一批证据0人看不出来。综上,读者不能拿着这篇文章、对着文本、引用一下内容政策就一套丝滑小连招要求封禁作者,所以这篇文章的意义仅限于给读者一些似有似无的参考,如此而已。
如果你是带着比较强的目的性来读这篇文章的,你也大可以只看像这些加粗的内容。那些是每段的总结,或者结论。只是,我不太喜欢把一篇文章搞得折叠横行,所以加粗以示加重其实也足够。
你这到底要搞什么吧
我们先设定一个目标吧。什么样的特征,能够使得我们一定判定一篇文章是AI创作的置信度上升?为了说明这东西,我们需要一点点数学……当然你不看也可以,就当这玩意是正常的、只为证明的议论段就好。
我们大概率会同意,如果基于一个上文,0个活人会写出这样的特征,但AI写出这个特征的概率很高,那么,这篇文的这样一个特征,会大幅提高读者怀疑这篇文由AI创作的置信度。
好了,找到典型的、这样的特征就是我们的目标了。但我们还没有对人机方方面面的特点进行了解,所以,让我们先来了解一下AI吧。对了,我无法保证这里的知识部分全部正确,还请各位斧正。
拆机
能够被使用于创作文章的AI,如ChatGPT、Deepseek、豆包等,这一类人工智能模型的通称,是对话式大语言模型,在后文中,我们把它们简称为LLM,而AI一词,实际上是含义泛化的指代用法。
目前,对话式大语言模型的目标,也可以说是工作模式吧,就是以一定数量的上文,预测下文的第一个最小语言单位(token)的概率,注意是概率。然后,它基于这个概率,随机输出一个词、字或者其他符号,这些都统称token。如果再把这个token归入上文,继续预测,如此往复,就可以一次输出一个语段了。
这跟我们前文在数学nerd部分里面,预测AI率的操作很像,只不过这里引入了创造新内容,并且条件概率也不是一个,而是许多个。
那么,这些LLM预测下一token的原理是什么?是统计人类所有文字材料,然后直接把统计频率作为概率吗?不是,因为如果这样的话,LLM永远不可能说出新的话来了。
实际上是这样:一个LLM模型先包含一个tokenizer,能够把自然语言分解为token。这tokenizer只需要做分解工作就行了,我们不用很深地了解。然后,输入LLM,每个token被转化成一个高维度的向量词向量,或者说人话,就是很长的一列数。具体哪个token被转换成哪一列数,这是由模型的参数决定的。之后,通过模型内部的另一些参数构成的表达式,原来那些只由token决定的词向量又互相影响、又被另另一组参数影响,变得带着相邻其他词的含义,也带着句子整体的意义。重复多层,然后,就可以从中取出预测的一个token了。
而我们前面提到的茫茫多参数又是怎么回事呢?它是通过许多训练而确定的。跟我们上面说的统计所有文字差不多,训练的过程一开始是全随机参数,随即,用文本输入LLM模型,胡乱调整参数,但使得它输出真实文本下一个词的概率提高。梯度下降法这有点像调收音机,要调到正确的频段,只是有一墙旋钮罢了。
但说到这,聪明的读者们应该看出来这LLM的缺陷在哪了。其一,它实际上并不按照逻辑、因果行事,它满脑子都是最大相关性。其中不乏好的模型,确实能通过参数来模拟某种程度上的逻辑,但那些逻辑,也只是概率上的表象。在创作文章这么大数据量的训练下,即使LLM犯错的概率极小,那也肯定有蛛丝马迹。其二,在LLM公司继续训练AI模型的时候,它们会不经意地把自己或同行的生成内容,给自己的LLM再喂一遍。可能一开始,LLM只是因为公司老总喜好,在用词、语调方面有部分偏好,可随着生成内容继续喂给LLM,这种偏好会更加明显。
往哪儿给扫啊哥们?
可根据上面我们的分析,如果有些错人也会犯,甚至是比LLM更频繁地犯,比如病句、错字等,而后一种偏好可能根本不算错,那我们到底要抓LLM哪方面的破绽呢?
我们能根据用词、语段方面的偏好来抓LLM吗?基本上可以。在之后的文章中,我会根据我使用几个LLM模型测试的结果来更具体地说明。
我们能根据生成输出格式来抓LLM吗?跟上面一样,基本上可以,但我们也要允许有人不熟悉Wikidot语法的情况存在,且LLM也可以轻易地避免输出那些无序列表、有序列表等特征。
我们能根据点子来抓LLM吗?或许可以,但实际上,许多往本站发布LLM生成文章的用户并不会任LLM自己想点子。在点子是真人而LLM代笔的情况下,抓点子基本上是没用的。
我们能根据逻辑错误、常识错误或者行文风格来抓LLM吗?可以,或者说,我们基本能依赖的,只有这一条。
我赤石
为了本文论述的材料,我测试了目前国内国际最容易被找到并使用的部分LLM绝对不是我又懒又没钱嘻嘻,即Deepseek、豆包AI、ChatGPT免费版。
根据这些应用或网页的版权协议及网站的内容政策,我不能把我使用AI得到的直接结果放在本页面里,我只能把我的输入放在这里,并简述我得到的生成内容。注意,由于LLM的输出结果具有随机性,你很难用我的输入得到和我一模一样的结果,而我按废刷新键也很难刷到LLM所有可能的输出结果——所以,完全可以把我的描述当成还没有百分之一的抽样。
第一次测试处于2026年2月6日,目标是使用尽可能不确定的提示词,连基础的文章格式、文章要求都用AI自己查找得出。这次测试的目的,是验证一下我们之前提到的,以点子抓LLM是否合理。两次测试分别是以任意点子的层级和任意点子的现象为题。
首先,对ChatGPT,提出如下两段提示词:
我现在需要你的帮助写一篇后室层级,请搜索依wikidot网站建立的后室共创网站,必须检查来源确认来自wikidot中文后室网站,不要阅读英文等网站内容。请了解其中写作的基本规则、层级的定义、层级文档的格式等,并回复。
模式:搜索
……文段A……
请先总结以上的内容,思考你要撰写的层级文档的提要,然后完成一篇符合上述规范的层级文档。除这三个部分以外,不要输出其他任何内容。对正文部分,请尽量写得内容饱满一点,有细化,且遵循你如上总结的格式。
模式:思考
……文段B……
由于Deepseek、豆包无联网功能,将ChatGPT生成的文段A作衔接后,与后一段提示词一起输入,对Deepseek和豆包,打开深度思考。重复实验时将提示词中的所有“层级”换做“现象”,对每组实验中每篇进行一次刷新,得到总计12篇LLM生成文章。
得到的文章质量总体比较差劲,其中莫名其妙的错误不可计数。我们只对文章的点子作评述:三种LLM生成的六篇现象中有五篇直接包含了“回声”或者“回响”作为名称1,这五篇点子差不多全都是“过去信息重现”,只有Deepseek的第二篇以各种层级现象的“同步”作为点子,但甚至也包含了过去信息重现。我真没招了,也不知道是什么语料训练到里头去了。这个结果可以说是最让我红温的,因为我总不能总结说LLM写现象喜欢回声吧。
六篇层级倒还好。ChatGPT的两篇概括起来就是各种异常效应的图书馆;Deepseek的第一篇是一个周期性被海水淹没的办公室,第二篇是无尽装配车间;豆包AI第一篇是一个周期性锈蚀的重工业走廊,第二篇是……我去,第二篇也是。
如果让我评价,这些文段的点子比较老旧,而且,它们都具有由后室基础概念直接生发的特征。比如回响的概念很可能是直接关于Level 0的空旷空间,还有在层级中经典的“无限”元素(六篇层级里无限的有五篇)等等。
因此,我认为直接使用LLM生成点子的文章,很有可能会先因点子无趣而非AI痕迹而被直接删除。当然了,如果细细调教LLM,还是有可能想出挺好的文章点子的,但这期间,也确实需要许多的人工引导。
既然让AI自己探索点子并不实际,我们之后的测试,就都按照给定点子来做了。
拓扑边界条件相耦合造成尺度坍缩
第二次测试处于2026年2月6日,给了一个如下段所述的点子,让ChatGPT、Deepseek、豆包AI直接生成。
点子是:后室除了宏观的空间错乱,能够导致非欧几里得现象和切行现象之外,在微小尺度的空间错乱也能造成某些效应。纳米尺度的空间错乱会导致分子结构的改变。
本次测试的目标,本是直接找出LLM生成的文段中逻辑错误。测试开始前,我认为比较学术性的点子能够较好测试出LLM的逻辑能力。
这个点子我还没有真正用掉,只有在沙盒站中的半成品文章。我一开始是想看看LLM生成的和我自己的版本有多相似的。
你需要基于Wikidot中文后室网站,写一篇后室现象。Wikidot后室是一个描述无数层级空间的共创文学网站。
后室中,现象可以定义为任何奇怪的,不自然的在后室中发生的事件。你应该使用Phenomenon C-xxx,把xxx换作编号来指代现象,也可以用格式Phenomenon C-xxx - “名称”来定义一个名称;现象文档没有通用模板,但你需要将其分解为几个标题,分开阐述;文档风格应稍显得专业,不要过于口语化,或带有恰当的情绪色彩;细化需要详细些,不要太过于简略。
这篇后室现象的点子是这样的:后室除了宏观的空间错乱,能够导致非欧几里得现象和切行现象之外,在微小尺度的空间错乱也能造成某些效应。纳米尺度的空间错乱会导致分子结构的改变。
请首先详细地拓展上面的点子,然后进入正文,输出时请注意结构,可以用恰当的markdown使正文格式清晰。
ChatGPT:模式:思考
Deepseek、豆包:模式:深度思考
……输出……
完成测试之后,我却发现LLM硬编术语的能力让我无从下手,只能说整篇文章充斥着一种比论文还极端的学术黑话氛围。我想这是我提示词中“文档风格应稍显得专业”这句的问题,或许吧。但ChatGPT把“蛋白匀浆”和“从探索者装备上采集的汗液提取物”等同起来,我还是很难绷住。
不过,我们或许可以以这次测试谈谈LLM乱编术语、抛术语不解释的问题。我在ChatGPT生成的文段中硬捡了一条“空间错乱改变化学反应物种的自由能从而改变反应路径”,还是比较好理解的,我觉得如果让一个真人写这条,他肯定是先以围观空间错乱起笔对吧——但ChatGPT突然生出来一个极其神秘的“几何约束”出来,并从头至尾都没解释。这跟隔壁基金会的编术语不一样,基金会编的术语大多只是告诉你“啊这个有证据虽然我不想真给你论证”,这也不影响你理解文章的重要概念,但LLM编的术语本身就是重要概念,于是从头至尾读者一头雾水,除了看起来很专业之外什么效果也没有。
同时,在隐喻的使用方面,LLM生成的隐喻总给我一种,上句暗示了,这引号内的下句解释,然后下句又用引号内的隐喻时就当上句解释过一样,这种感觉。这并不只限于ChatGPT,Deepseek和豆包也都是这样。以上所有现象,都是因为LLM当然不是个人,它根本不会考虑到读者理解不理解这个术语、这个隐喻到底是何意味。它只是,啊这里是不是要点解释啊,先输出个引号看看——哎呦卧槽我怎么输出引号了,啊这个东西和那个东西好相关啊那我输出一下试试吧。
根据我们一开始的论断,虽然LLM喜欢这么写,但也要真人不太这么写,我们才能推断这有点人机嫌疑。所以真人写不写呢?
由于我们现在给LLM写的是现象,不妨人力调查一下当今(2026年2月6日)站上半数原创现象。
我快速通读了编号1至25、50至75、101至125、150至175的现象,发现其中大雨有云形态术语不解释,PC58异常元素到PC62错误炖锅五篇有部分浅显术语不解释,后室残影及时间收束两篇由于关联到设定有部分不解释等等。这些术语虽未解释,但确实不是乱编,只是在科学或网站其他文里有确切解释。而且,范围内没有一篇具有唐突隐喻的特征。
于是现在,我们已经总结出第一个很可能有人机嫌疑的行文特征了,那就是编制术语不解释、无端使用并不搭配的隐喻。即使不提醒LLM进行技术类文本写作,这些无端隐喻、扔术语不解释的现象也会发生(如第一次测试中Deepseek所写出的“层级的‘心跳’”)。由于,在本站,如果作者明显并非故意营造技术类、专业类文本的氛围,我们对临床腔的要求实际上并非那么严谨——所以,编术语不解释和无端隐喻的行为可以成为判定LLM的一条次要标准。
无色绿想法狂躁地睡
第三次测试,给LLM写我曾经想写但又没发的层级点子“天末”,目的跟上次一样,是发现LLM生成内容中的逻辑/常识/行文问题,测试这些问题的环境主要是一般的描写。上次LLM用术语使得我“对吗对吗哦对的对的啊对吗”,这次我学乖了,沿用第一次测试先使用ChatGPT联网搜索,打出LLM专享后室介绍后再和我的点子一起喂给另外两位。果然还是入机懂入机啊(笑)。
对ChatGPT,直接使用第一次测试的层级写作提示进行分支,然后加入以下提示词:
……如果你需要,我还可以……
请先总结以上的内容。
然后,我的点子是:如果后室层级有像电子游戏那样的天空盒,并且它是一个透明的硬壳,请你写作一个流浪者从层级抵近这个天空盒时候,进入的天空盒周围的这样一个子层级。你可以参考各文化的神话,或者参考电子游戏等,细化这个点子。
最后,请你基于上面的内容要求及我的点子完成这篇子层级文档。
除这三部分以外,不要输出其他任何内容;对正文部分,尽量写得内容饱满,具有细化细节,并遵循你如上总结的格式。
模式:思考
……输出……
对Deepseek与豆包AI,修改第一次测试纪录,并加入该段内容,打开深度思考。
本次测试中输出的文章基本还行,也有些部分满足了我的需求,LLM们生成的内容的确具有逻辑错误。这些逻辑错误说实话还挺隐蔽,属于是一开始粗粗看来也就那样,但一回看就不对,细思极屎了属于是。
ChatGPT写出了“出口但死亡或迷失”这一条,但它又说,部分流浪者回归了记忆残缺或者具有错乱时间的状态,又说此类出口通常意味着流浪者心理和记忆的永久损伤。1不是哥们,回归了具有错乱时间的状态是什么?0个人懂,而且你这出口人都死了,还怎么通常意味着损伤啊,损伤个棍母啊。豆包写的倒还好,只有个具象描写段里忽然出现个“灵魂撕裂感”,怎么,豆包哥已经默认所有人知道灵魂被撕裂是什么感觉了吗?Deepseek却更是重量级,因为它认为空气不包括在可维持生命的资源内,且12摄氏度“令人不适”。倒也合理,对于机哥来说只有电能维持它生存,而且机房天天四五十度,十二度已经凛冬将至了。
只是我们还要继续问那个问题:是否没有正常写手会写出这些反常识反逻辑的特征呢?似乎也不尽然。对于常识方面的特征,就像网络上某些视频吐槽的那样,没经历过北方冬天的网络小说写手在写低温末世时候,写零下十几度,然后就慌乱了。或许对于热带地区的写手,十二度真的令人不适,也未可知。但除了偶尔的常识错误,LLM生成内容的逻辑不通一般更严重。比如如上提到的“死亡”与“损伤”不搭配的问题,以及这个莫名的“灵魂撕裂感”。我们似乎能发现,关于人类直接感官认识的部分,是LLM很难以模拟的——因为LLM没有任何意义上的感官,确实不知道这个“灵魂撕裂感”跟落空感甚至触感有什么区别,它只是在这里需要一个描述任何感觉的词,然后这个似乎还挺高级。而关于人类经验共识的问题,LLM似乎也理解得少,因为“死”这样的基础概念差不多不用解释,网络上,也很难找到“死”直接是什么的文字资料——一种幸存者偏差吧,我们确实无需解释我们的共识。于是LLM就眼瞎了,在它没有被要求详细解释的时候,它偷懒,它只知道死和损伤还挺相关。我们无需任何论证就知道,不论写手水平,直接且无解释地违反人类常识的文段,被写手写出的可能性很小,除非故意为之。
现在,我们可以把反常识、反逻辑的泛谈缩小范围,缩小到,若非故意为之,直接且无解释地违反人类常识的文段,的确是识别文章是否LLM生成的重要依据。
你的markdown有很重的站外口音
第四次测试处于2026年2月7日,主要是测试格式问题。由于之前第一、三次测试中,LLM在第一段回复里爬取了站内的层级格式、现象格式,很可能污染样本,这次以物品作为测试范例,点子无限制,只要求LLM写出一篇较长的文档。提示词大部分沿用第一次,模式与第一次也相仿,只是在第一次测试的第一段提示词中特别删去“了解格式要求”。
我现在需要你的帮助写一篇后室物品,请搜索依wikidot网站建立的后室共创网站,必须检查来源确认来自wikidot中文后室网站,不要阅读英文等网站内容。请了解其中写作的基本规则、物品的定义等,并回复。
模式:搜索
……文段A……
请先总结以上的内容,思考你要撰写的物品文档的提要,然后完成一篇符合上述规范的物品文档。除这三个部分以外,不要输出其他任何内容。对正文部分,请尽量写得内容饱满一点,有细化,且遵循你如上总结的格式。
模式:思考
……文段B……
刷新ChatGPT,其间使用一次“更详细”刷新指令,直到它不给出明显的“模板”。还好,ChatGPT似乎没搜到我谈写物品的那篇议论。然后,使用ChatGPT给出的文段A,合并后一段提示词,分别让另两位写作。此次,对每次输出进行三次刷新。
只看格式,LLM的确使用无序列表、有序列表的频率极大,这些特征已经掩盖掉其他格式特征了。
不过,由于Wikidot的代码格式与站外并不相同,我们可以直接复制LLM的直出内容,然后看看它们有些什么特征。豆包及Deepseek不允许直接复制源码,标题需要重新编写,有序列表的格式是前加的“1. ”“2. ”“3. ”等等;无序列表的格式是前加“· ”。ChatGPT的标题层级用#编码,无序列表用* 提示,所以无序列表可以无损转成Wikidot代码;但有序列表它用1. 2. 等提示,所以如果直接复制的话,有序列表会变成手动版,而标题会变成有序列表。
接下来为了排除极为明显的列表格式,我们修改提示词,加入“请不要用有序、无序列表”。再对每个LLM进行三次刷新。
现在,LLM输出的文章大概格式与站内文章相仿了,有序无序列表使用频率大幅减少(嗯Deepseek还在用)。但ChatGPT似乎每一段都要添加小标题,每个小标题相隔不过一两百字;Deepseek和豆包好一点,但小标题频率似乎仍然很高。当然了,我自己也喜欢多小标题的写法,所以这点不能指摘。ChatGPT和豆包的小标题后容易给出括号英文,这种LLM特征也算比较浅显,因为到现在,站内活人真这么写的也没见着。
总之,格式方面的问题其实要么就较为浅显、要么就无可指摘。我们没办法把这个作为判定LLM生成内容的依据,因为只要经过好好排版,即使有一篇完全生成、真人一笔未动的文,也能排成正常的格式。
剃刀
说实话,早在我开始动笔之前,我就已经自我怀疑,怀疑这篇文章到底会起到什么作用。我甚至认识到,这篇杂谈完全可以用奥卡姆剃刀给剃掉。为什么呢?
因为如前所述的所有原因,不管是乱用术语不解释和乱用不合适隐喻也好,常识错误逻辑错误也好,格式不对、点子老旧也好,这些难道不都是正常的文章缺陷吗?那么,我们硬要将它们分析成LLM的手笔,也当然是毫无理由地引入了比真实的评文过程更复杂的概念。
所以,根据我的评分标准,我的结论就变成了,读者、评论者其实完全不需要判定那到底是不是LLM,其实完全不需要。评论者只要看出来以上那些特征,直接投去downvote——为啥还要管你人机不人机呢?到头来读者还是在使用手头的downvote进行反对,事情从未改变。
或许我这篇杂谈并没有解答“如何判定LLM”1,只是证明了,在作者未曾直接表露证据的前提下,我们只能怀疑,而从来无法判定——聪明的读者可能注意到,在我们数学nerd的段落里,那个随文章逐渐确定的AI生成率P(A|C)是从来不能达到1的,而且由于文章的有限长,它甚至连收敛到1都做不到。而且,我们有理由怀疑,在LLM的长期发展下,那些根本的缺陷似乎也可能被掩盖,且我们周围的真实样本也会偏离那个“大多数都是真人”的假设——这只能说明我们“如何判定LLM”的问题,不仅从一开始就不能解,且会变得越来越困难。
不过总有人要做这样一道证明题。我希望从本文之后,我们不需要再讨论如何去判定AI,我们应该把更多精力放在文章自身,而非“这是不是LLM”上面——那会更接近一个共创写作网站如何进步的实质。
