绿野
书名:打架成本警示牌|作者:笑无语|本书类别:古言|更新时间:20:13:17|字数:3896字
A | 昨天看到了一篇论文,特别有意思,让我连夜读完了。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。

B | 针对生物多样性保护面临的严峻形势,每一个人、每一个行业都要参与其中,开启新的生产方式和生活方式。 这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。 生物多样性使地球充满生机,是人类赖以生存和发展的基础,是地球生命共同体的血脉和根基。

C | 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。 结果出来以后,太好玩了。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。然而,受自然生境的丧失与破坏、自然资源过度利用、环境污染、外来物种入侵、气候变化等因素影响,全球物种灭绝速度不断加快,生态系统服务功能明显衰退,严重威胁人类生存和可持续发展。 《生物多样性公约》第十五次缔约方大会(COP15)第二阶段会议于2022 年达成“昆明-蒙特利尔全球生物多样性框架”,以实现人与自然和谐共生的2050 愿景,提出2030年之前须采取紧急行动,希望借此遏制和扭转生物多样性丧失的趋势,使自然走上恢复之路。 为积极推动《关于进一步加强生物多样性保护的意见》落实和“昆明-蒙特利尔全球生物多样性框架”执行,有效应对生物多样性面临的挑战,2024年初,经国务院批准,生态环境部发布《中国生物多样性保护战略与行动计划(2023—2030 年)》,明确我国新时期生物多样性保护战略部署、优先领域和优先行动,并提出要推动建立政府主导、企业积极行动和公众广泛参与的生物多样性保护长效机制。 Claude Sonnet 5更离谱,30次回答里疯狂输出47。 如何推动战略行动落地落实?2024年3月29日,中国生物多样性保护与绿色发展基金会(下文简称中国绿发会)主办的首个响应“推进国家生物多样性保护战略行动计划”座谈会在京召开,广邀各界专家学者、企业代表深入探讨。 Llama 3.3,则多数是53。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 “全球有超过30亿人的生计依赖于海洋和沿海的生物多样性,超过16亿人依靠森林和非木材产品谋生,有50%以上的药物成分来源于天然动植物,还有占全球一半的GDP依赖自然及生态系统。但是,这些年来生物多样性丧失的状况始终没有得到有效缓解。 而且非常好玩的是,每个模型的执念都不一样。 GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。生物多样性丧失问题和气候变化一样,成为了威胁人类可持续发展的全球性危机。”中国绿发会理事长谢伯阳在会上强烈呼吁人们加强对生物多样性的保护,直言“没有生物多样性,人类就没有未来”。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。摄影/宁颖 危机迫在眉睫 我国幅员辽阔,陆海兼备,地貌和气候复杂多样,孕育了丰富而又独特的生态系统、物种和遗传多样性,是世界上生物多样性最丰富的国家之一。作为最早签署和批准《生物多样性公约》的缔约方之一,我国一直高度重视生物多样性保护,不断推进生物多样性保护与时俱进、创新发展,走出了一条中国特色生物多样性保护之路。

D | 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。 中国科学院生态环境研究中心原主任、研究员,美国国家科学院外籍院士欧阳志云从事生物多样性保护研究多年。在他看来,近些年,我国生物多样性保护取得了很大的成就,政府高度重视生物多样性保护,划定了生态保护红线,面积达到国土面积的32.6%,其中已建成的国家公园、自然保护区、森林公园、湿地公园等各类保护地总面积约占国土面积18%。“根据国家林草局等部门联合发布的《国家公园空间布局方案》,到2035年,我国将建设49个国家公园,总面积约110万平方公里,分布5000多种野生脊椎动物和2.9万余种高等植物。全部建成后,我国国家公园面积总规模将是世界最大,也是保护我国生物多样性的最好机遇。” 同时,他也强调,我国生物多样性保护仍然任重道远。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。对此,他进行了进一步解析。一方面,生物多样性丧失是全球性的生态危机,地球正面临第六次生物大灭绝,前五次主要是由地质活动造成的,而现在的生物灭绝则是人类活动造成的,且速度比以往更快,是以前的100倍甚至更多。另一方面,由于栖息地的丧失,新物种的形成环境丧失,生物多样性丧失的危机也比其它任何危机影响都更深刻更长远。而我国生物多样性保护也面临许多挑战,尤其是生态系统质量低,全国70%以上的森林、草地不同程度退化,有4000多种植物、1000多种动物是受威胁物种,有的动植物物种极度濒危或濒危。 “生物多样性既是可持续发展的基础,也是目标和手段。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。从保护自然中寻找发展机遇,才能实现生态环境保护和经济高质量发展双赢。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。

E | 所以说,为啥布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证,看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。

F | 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。”谢伯阳强调,我们需要在全社会尽快形成生物多样性保护的共识,在政府的引导下,通过加快推进相关立法,增加财政支出,调动更多优势资源,让每个人能参与到生物多样性保护行动中来。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。 科学谋划,高效推进 “生物多样性的保护一定要以科学为基础,避免盲目性。”中国水利水电科学研究院水力学研究所原所长、总工、博导刘树坤分析表示,第一,生态系统碎片化。

G | 只需要模型输出一个 Token,就够锁定你是谁。

H | 伴随着城市快速发展,高速公路、铁路、建筑物越来越多,将生态空间切割成了一个个碎片。 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。目前主要还是采取保护区的方式进行保护,保护区与外界缺乏交流,长此以往也将对生物多样性产生影响。

I | 如何解决生态系统碎片化的问题,仍需进一步研究。第二,外来物种的入侵是保护生物多样性的另一大挑战。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。我们既要开展生物多样性保护,又要避免外来物种进入本地生态系统中,但现在由于利益驱动,很多地区对一些外来物种习以为常,而人们对这些外来物种的进入将对本地物种产生怎样的影响尚未可知。 你付了Claude Opus 4.8的钱,你收到了一段回复。第三,关于生态系统食物链的关系研究仍较为欠缺。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。一个地区的生态系统往往是通过食物链的网状结构互相维持的,每一个物种的灭绝,就相当于这个食物链的网破了一个洞,都将影响到周边几十个物种的生存环境,破洞多了,网本身也就不能成立。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。 而且这事之所以这么普遍,纯粹是经济结构决定的。 “因此,基于这样一个关系,我们在做生物多样性保护的时候,最关键的还是补洞。”刘树坤指出,目前保护的物种多是珍稀物种或经济价值比较高又或观赏性比较强的物种,“但这些都不是食物链网的关键物种,怎么样通过更科学的立法来动员大家采取行动,是重中之重”。

J | 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。

K | “中国生物多样性保护已经上升到国家战略行动计划的高度层次,接下来需要法律的密切配合。”中国人民大学法学院教授周珂同样呼吁,要加快生物多样性保护的相关立法。

L | 比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 近年来,科技赋能生物多样性保护的优势逐渐显现,中国环境科学研究院正高级工程师徐靖指出,要回答昆明-蒙特利尔2050年全球长期目标提出的生态系统物种和遗传资源、遗传多样性三个层次的变化趋势,离不开坚实的科学数据和信息支撑。她建议,应开展生物多样性本底调查研究,摸清家底,了解生物多样性受威胁因素,并对重点生物类群、重点物种开展动态监测。

M | 王大成是中国科学院国家摇杆工程中心副书记、研究员,利用遥感技术给环境“问诊治病”是他近年来一直在做的事情。

N | 但问题在于,CISPA这套LLMmap的方法依然很重。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。 布鲁克纳真正牛逼的地方就在这里。在会上,他以野骆驼生活栖息地监测为例,介绍了利用卫星遥感技术对生物多样性环境数据进行精准获取的方法。

o | 他表示,希望今后可以将这种监测方式延伸到更多物种的保护。

p | 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 此外,生物多样性保护还离不开大量的资金支持。中央财经大学绿色金融国际研究院副院长崔莹分析称,目前支持生物多样性保护或者绿色发展工作的资金来源主要有财政和金融支持两个方面,财政支持更多的是公共资金,现在我国在进一步构建绿色金融体系,为的还是运用社会资本来支持绿色发展和生物多样性保护领域的工作。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。

q | 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。

r | 而助力生物多样性保护,提高现有资金使用效率和增加资金来源便成了题中之义。她提醒,目前,我国的金融机构投向生物多样性领域还缺乏一个可以供其参照的生物多样性金融相关目录。 同心同行,聚力一战 为加强生物多样性保护,我国正在加快构建以国家公园为主体的自然保护地体系,逐步把自然生态系统最重要、自然景观最独特、自然遗产最精华、生物多样性最富集的区域纳入国家公园体系。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。

s | 2022年年底,国家印发了《国家公园空间布局方案》,科学布局了49个国家公园候选区(含正式设立的5个国家公园),提出到2035年,我国将基本建成全世界最大的国家公园体系。届时,我国国家公园总面积将有约110万平方千米,覆盖森林、草原、湿地、荒漠、海洋等典型生态系统,以及生物多样性、自然遗迹富集区域,保护80%以上的国家重点保护野生动植物物种及其栖息地。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 欧阳志云对此表示肯定,他强调,我国需加快推进以国家公园为主体的生物多样性的就地保护。一是加快国家公园建设进度,加快《国家公园法》的立法,依法推进国家公园建设,协调建设管理过程的问题与矛盾。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。

t | 这个跟上文我们提到的LLMmap的准确性已经差不多了,但是要简单太多了。

u | 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。二是构建适合我国国情的国家公园管理体制。

v | 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。 布鲁克纳的系统会给任意两个模型的指纹算一个相似度分数,数字越小代表越像。 同一个模型在两个不同供应商那里各部署一套,因为服务器环境不一样,两边的指纹也不会100%一致,这种自己跟自己比的正常波动大概是0.140。 Palmyra X5跟Qwen3-235B的差距是0.141,和一个模型自己跟自己比的波动几乎一模一样。 这下事情就非常的尴尬了。

w | 需要注意的是,我国国家公园内还有许多居民,在保护生物多样性的同时,也需要保障当地居民生活水平不断提高,这就要求我国探索建立独具特色的国家公园管理体制。三是规范国家公园管理机构和管理建设。我国国家公园通常面积较大,在范围上大多涉及多个省区或多个市县,建立怎样的管理机构也是个难题。

x | 四是完善生态补偿制度。国家公园不仅保护生态系统中最重要、生物多样性最富集、自然景观最独特的区域,还在保障我国生态安全方面发挥着重要作用,因此需要进一步根据国家公园保护生物多样性的价值与贡献完善生态补偿制度,激发地方建设国家公园积极性。五是加强科技支撑,通过科学技术的创新与进步,建设好、管理好国家公园。 中央民族大学教授、民族地区生态环境国家民委重点实验室主任龙春林同样在关注以国家公园为主体的自然保护地建设情况,他一方面对实行就地保护这项工作的重要意义予以肯定,另一方面强调,迁地保护作为补充与就地保护相辅相成。“国家公园体系建设虽然已经启动,但仍存在很多问题,包括一些科学问题、技术问题、法律法规缺失问题等。

y | 布鲁克纳在论文里措辞很克制,说这只是统计性观察,不是对意图的指控。这对我们进行迁地保护是不利的。今后,在国家公园体系建设的时候,一定要多关注这些问题,要把我们的国家公园体系建好,把迁地保护做好。 但是,数据和代码全部公开,任何人都可以复现。 网址在此:https://zenodo.org/records/21278557 整套东西,非常有意思,而且不止数字,还有颜色等等等等,这个扩展性和上限,我觉得极高。 模型的随机并不随机,给了这种行为指纹非常值得探索的空间。” 留坝县地处秦岭南麓腹地,位于陕西省的西南部、汉中市的北部,是秦岭生态安全屏障的组成部分、国家南水北调中线工程重要的水源涵养地,肩负着保护秦岭生态生物多样性重要使命。 我觉得比审计结果本身更好玩的,是一个更底层的问题。 AI为什么就是不能生成真正的随机数。

z | 之前帮影视飓风弄了个视频,就聊过这个话题,在AI视频里抛硬币,其实概率根本不是55开,是73开。 会议当天,陕西省汉中市留坝县副县长吴鹏程的出现令人欣喜,作为与会的唯一县域代表,他详细讲述了当地用传统的中华蜂群酿造出“来自秦岭深处的甜蜜”,成就地方特色品牌,并在享受生态环境带来的经济发展红利的同时,通过建立中华蜜蜂遗传资源保护区,防止外来蜂种影响中华蜜蜂的生存,加强当地生态环境的保护,反哺生态环境的故事。 在这个布鲁克纳的测试里,也是一样的。 1到100的随机数这个任务的标准答案,所有人都知道,应该是均匀分布,100个数字每个被选中的概率严格1%。 但165个模型,一个都没做到。 论文里用了一个叫熵的指标来衡量回答到底有多随机,应该有无数人见过。

| “生物多样性保护除了维护地球生态平衡、建设可持续生态系统的应有意义之外,更重要的是有效落实生物多样性保护,对发展诸如蜂蜜、林下中药材生态种植等富民产业也将产生促进作用,有助于极大提升产业发展的含金量,实现含绿量和含金量的有效统一。”吴鹏程感慨道。 “今天生物多样性保护面临的形势是严峻的,怎么办呢?其中一个重要的问题就是人民参与。

| 让所有人民都参与,每一个人、每一个行业都要参与到这项行动中,开启新的生产方式和生活方式。只有这样,面对百年未有之大变局,面对第六次生物大灭绝危机,我们才有一战之力。

| 这玩意你可以简单理解成不可预测程度,数字越高代表越难猜,越接近真正的随机。如果1到100的分布是完全均匀的,熵应该是6.64 bit,也就是你几乎没法猜到下一个数字是什么。

| 但165个模型的中位数只有1.0 bit,差了五六倍。 AI回答随机数的时候,信息量只有真随机的六分之一,高度集中,高度可预测,高度非随机。

| 其实这个事,心理学和行为经济学研究了很多年。”在会上,《“携手保护生物多样性 共同促进绿色发展”倡议书》正式发布,中国绿发会副理事长兼秘书长周晋峰诚挚呼吁社会各界积极行动,共同为推进生物多样性主流化、促进美丽中国建设、共建地球生命共同体贡献合力。 来源:《小康》·中国小康网记者 刘彦华 校对:李旭颖 审核:龚紫陌。 不光AI,人类也不会生成随机数。 有一个经典实验,让一群人闭上眼睛说一串随机数字,结果呢,发现人类非常强烈的倾向避开重复、避开相邻数字、偏好奇数。 你让100个人说一个1到10的数,7被选中的概率远远高于10%,因为人脑觉得7看起来比较随机,而5和10看起来不够随机。 大家可以回想一下,自己是不是这样。 我们看到的绝大多数随机,可能只是隐藏因果关系在认知中的投影。 AI面临的是一模一样的困境,只不过原因不同。 真正的随机,要求你是一张白纸。 但大模型恰恰是人类有史以来造出来的信息密度最高的非白纸。 训练数据是数十万亿的token,几千年文明的总和。 每一个权重参数都编码着某种规律、某种偏好、某种从语料里沉淀下来的肌肉记忆。 所以你让它随便说一个数,它根本没法真正随便。 它只能从自己见过的所有文本里,找到一个最像随机数的答案。 42为什么被那么多模型偏爱? 因为它是《银河系漫游指南》里“生命、宇宙以及一切问题的终极答案”。 7为什么总被人类选中? 因为它在宗教、文化、文学和日常语言里,被反复赋予神秘、幸运和特殊的意义。 37、47、53这些数字为什么频繁出现? 因为它们是奇数,是质数,不圆整,不对称,看上去更像一个没有经过思考、随手蹦出来的数字。 可恰恰因为所有人都觉得它们更随机,它们才变得最不随机。

| 大模型只不过把人类潜意识里的这种偏见,压缩、放大,然后写进了自己的概率分布里。 我们总觉得模型是一个冷冰冰的数学机器,每次回答都来自概率采样,充满不确定性。 但当你把几十万次回答遍历回测,把那些看似随意的选择叠加在一起,你会发现它其实一点都不随意。 它们也有自己的偏爱,有自己的执念。 参数可以被量化,系统提示词可以被修改,名字可以被重新包装,外面甚至可以套上一层完全不同的壳。 可它在亿万次训练中形成的概率习惯,依然会从一个小小的Token里漏出来。 爱因斯坦说过,上帝不掷骰子。 而AI,也不掷骰子。 它每一次以为自己在掷骰子的时候。 掷出来的,都是自己。 >/ 作者:卡兹克。



