打算用 JEV 来判断文本是不是 AI 生成的。虽然我知道这大概率不可行,就只是打算玩玩看。
把活派给 Agent 让他自己找 200 条人类语料先看看假阳率。Agent 翻找我电脑上的“语料”,列了个表格。xxx 是黄金数据源因为时间在 ChatGPT 诞生前;群聊消息可用,但也有 AI 润色污染过的风险;最脏的数据源是你的微博内容,我没法判断你有没有用AI。
“最脏的数据源是我的微博内容”虽然很有道理,但不能换一种表达吗?
另外简单的测试结果出来了,在“判断文本是不是AI生成”这件事上,JEV 和抛硬币差不多。