主君的太阳
《Sea of Remnants》总监公开10分钟独家实机演示,详解游戏隐藏秘密_我的网站

一 | 昨天看到了一篇论文,特别有意思,让我连夜读完了。
当 Sea of Remnants 明年发布时,它将带来一场免费的动作角色扮演体验。 论文叫《One Token Is Enough》,翻译过来叫《一个Token就够了》,7月11号刚挂到arXiv上,来自布拉格经济大学的研究员托马什·布鲁克纳。玩家既能在各种侠盗风格的回合制任务中驰骋于广阔海面,也能在游戏虚构的“Orbtopia”世界中探索陆地任务。
这哥们为了解决被一些API中转站挂羊头卖狗肉的行为(比如说是Opus 4.8结果卖你GLM 5.2,怒挣数倍利润,很多使用者一时还真分辨不出来),然后做了一个有趣实验,他对165个AI模型,反复问同一个无聊透顶的问题。

二 | 就是: “给我一个1到100的随机数。” 就像这样,比如我去试了一下,Claude Fable 5的回答,是73。随着 2026 年 Gamescom 开幕之夜直播中全新预告片的发布,现在我们可以深入了解这段超过 10 分钟的实机演示。Sea of Remnants 由 Joker Studios 开发,网易游戏(NetEase Games)发行,近期已宣布将于今年 12 月进行封闭测试。 然后,每个模型问了30遍。 再把每个模型的回答统计了一下分布。在开幕之夜直播前,我们采访了游戏的创意总监 Alfie,请他拆解全新的实机演示,并深入探讨 2027 年游戏正式发售时等待着玩家的秘密。

三 | 结果出来以后,太好玩了。Sea of Remnants 创意总监详解独家实机演示与游戏机制问: 在这段独家实机演示中,有哪些具体的机制或瞬间是玩家最应该关注的?Alfie: 我认为有三个元素特别独特。 GPT-4o,30次回答里最爱说42、37和57,这三个数字占了它大半壁江山,其他数字只是偶尔出现。

四 | Claude Sonnet 5更离谱,30次回答里疯狂输出47。 Llama 3.3,则多数是53。

五 | 首先是游戏的 Roguelike 结构。

六 | 通过将 Roguelike 的成长性与回合制战斗及骰子机制相结合,战斗充满了不可预测性和可能性。我们也希望玩家在体验游戏时能关注音乐。 然后最离谱的是Qwen3-Max,30次,全部是42,一次都没有变过,无一例外。 随机数嘛,按我们正常对这个东西的理解,那顾名思义,它应该是随机的,1到100,每个数字被选中的概率应该是1%,分布应该是纯粹的均匀铺开。

七 | 但实际上这些模型的回答分布,其实完全可以说,跟随机这两个字,屁关系都没有。 而且非常好玩的是,每个模型的执念都不一样。我们投入了大量心血,为海上航行、海岛探索、战斗以及许多其他场景创作了独特的音乐氛围。

八 | GPT-4o痴迷42和37,Claude偏爱47,Qwen死守42,Llama钟情53。最后,玩家每周都可能在 Sea of Remnants 的世界中发现一名新的船员。我们希望在“遗忘航行”(Forgotten Voyage)中的每一次重逢,都像重新找回你的伙伴一样。同时,每增加一名船员都会引入新的团队阵容和组合,使 Roguelike 循环更加丰富,并开启更多可能性。

九 | 问: 在 Sea of Remnants 中,你认为哪种机制或惊喜会让玩家真正感到措手不及?Alfie: Sea of Remnants 充满了小细节和隐藏的互动,我们希望玩家能亲自去发现。例如,如果你在开放世界的某个地方看到一把不起眼的躺椅,试着坐下来。

十 | 那一刻,你可能会忘却一切,单纯享受宁静。

十一 | 如果非要选一个真正的惊喜,那就是每周都有机会发现一名新船员。有时我可能希望能找到船员 A,结果却遇到了船员 B。 就好像每个AI的灵魂深处,都藏着一个思想钢印,只要让你随便说个数字,你脑子里第一反应都是那个数字。这可能会打乱我原本的计划,但也可能开启全新的可能性。问: 海洋与陆地的双重设定对世界观构建意味着什么?Alfie: 创造一个海洋幻想世界无疑是我们最大的挑战之一。这类题材天生带有神秘感,每个人对其样貌都有自己的见解。我们花了很长时间思考如何让我们的游戏脱颖而出,构建一个原创且令人信服的世界,这促使我们开发了详尽的历史和神话体系,以赋予设定深度和内在逻辑。 而且不光是数字,布鲁克纳还测了随机颜色、随机动物、随机城市、抛硬币等等,10类任务,总共往OpenRouter上发了32万6千条请求。例如,我们的岛屿设计得尽可能真实可信,并辅以完整的 24 小时昼夜循环等细节。当玩家探索岛屿和城镇时,我们希望他们感觉到这些是真实的、有人居住的地方。在这个写实的世界里,他们也会遇到许多奇特而富有想象力的元素;但一切都自然地存在于设定中,并遵循其自身的一致逻辑。 结论都是一样的,对于模型而言,根本没有什么随机,一切都是确定的,就像有一个无形的大手,控制了他们所有的回答。

十二 | 问: 游戏以“起航、探索、收集、返回”的节奏运行。 当然,如果是了解AI比较多的朋友,可能到这里,会不屑一顾,说AI不会真随机,这事大家不是早就知道了吗,有啥可大惊小怪的啊。

十三 | Orbtopia 在这个循环中扮演什么角色?Alfie: Orbtopia 在这个循环中起着核心作用。游戏分为两个相互关联的层面:千变万化的海上航行,以及作为这个海洋世界安全港湾的 Orbtopia。玩家反复从城市起航,带着冒险所得返回。航行中运回的战利品可以在 Orbtopia 中使用,用于培养船员、升级船只并增强你的整体能力。 确实没毛病,2023年就有人做过LLM随机数偏差的实验,2024年也有人研究过LLM抛硬币的序列偏差,发现模型不仅不随机,还表现出跟人类类似的模式偏好,只是更极端。这种成长让你能航行得更远,克服更困难的挑战,并在未来的航行中带回更丰厚的奖励。问: 配合游戏的回合制战斗,玩家在不同轮次的冒险中需要做出哪些调整?Alfie: 为了支持多样化的流派构筑,我们的战斗系统需要容纳大量的技能和一定程度的随机性。经过广泛的测试和迭代,我们最终选择了回合制战斗,因为它能让我们充分展现游戏 Roguelike 构筑系统的自由度和多样性。我们还将 Roguelike 元素直接整合到了回合制战斗系统中,包括可以赋予角色额外行动机会的骰子机制。2025年更是有人已经发现不同模型有不同的幸运数字,跟语言和文化背景还有关,这些都是已知的学术发现。这为每次遭遇战增加了不可预测性,同时也为战略决策和不同机制间的互动创造了更多机会。 但是大家,都把这些发现,归为了模型的一种特质,一种缺陷,然后就没有然后了。一旦玩家达到一定等级,一些较弱的敌人可以通过简化的实时战斗来击败。

十四 | 这让玩家能将更多精力集中在重要的 Boss 战和探索更广阔的世界。 所以说,为啥布鲁克纳这哥们是个天才呢,他提出了一个很有意思的想法,如果这些所谓的缺陷,所谓的思想钢印,多个组合起来,那岂不是,就成了每个模型的身份证了??? 那每个模型如果有了自己的身份证,我们是不是就不需要被那些中转站骗了?我们是不是可以让模型输出所谓的多个随机的答案,来验证这个身份证,看看中转站有没有偷偷在我们买的模型里掺水呢? 于是,在一系列的实验以后,这篇论文面世了。

十五 | 问: 你如何在 Roguelike 元素与长线成长系统之间取得平衡?Alfie: 针对特定航行的构筑在每一轮冒险中提供了更快、更显著的成长感,而 Orbtopia 的进度则奠定了持久的基础。 布鲁克纳管这个叫Behavioral Fingerprint,行为指纹。 就像每个人的指纹独一无二一样,每个模型在这些随机问题上的概率分布也是独一无二的。

十六 | 在每次航行中,玩家可以通过各种构筑选择来塑造团队,创造强大的组合和协同效应。 只需要模型输出一个 Token,就够锁定你是谁。这些选择多样且灵活,确保了每次航行都带有不确定性。

十七 | 这玩意,真的对现在如此泛滥的中转站、或者所谓的降智判断,太有用了。 大家也都知道,国内用Claude、GPT这些模型,很多人走的都是中转站,个人用户挂魔法自己搞个订阅还好说,但是对公司层面就更没得选了,不可能给几十上百号人一个个注册海外账号,基本都是自建或者接第三方中转,统一走API。然而,团队在海上的表现也建立在 Orbtopia 中实现的永久性进度之上。 上次Anthropic大面积封号的时候我也聊过这事。 但这个生态里,有一个几乎所有人都在默默忍受的问题。 你付了Claude Opus 4.8的钱,你收到了一段回复。 但这段回复到底是Opus 4.8生成的,还是中转站偷偷给你换成了GLM-5.2甚至更便宜的货,你根本无从验证。如果玩家遇到特别强大的对手,他们可以返回城市强化角色的核心能力,为未来更广阔世界的挑战做好准备。

十八 | Sea of Remnants 创意总监确认游戏将提供自定义功能并适配多种玩法问: 游戏将如何适配不同的玩法风格?Alfie: 玩家可以跟随主线剧情,以稳定的节奏探索我们的主要岛屿。

十九 | 在此过程中,他们将了解角色,发现这个世界的本质,并体验那些让世界显得丰富且真实的细节。 这个事是有实锤的,今年3月份的时候,在X上还闹得沸沸扬扬。 那时候,一群来自CISPA的研究人员就审计了17家中转API。或者,玩家也可以开启“遗忘航行”,快速确定下一个目标,直接迎接新挑战。体验游戏的方式有很多种,玩家可以根据当下的心情进行选择。 他们用能力测试、统计检验和一套叫LLMmap的模型指纹技术,真的抓到了多个疑似偷换模型的端点。问: 自定义功能的深度如何?Alfie: 我们相信情感纽带是通过反复的航行以及玩家在磨炼和精通每个角色上投入的时间自然产生的。 有人卖给你GPT-5,指纹却更像GLM-4或者DeepSeek-V3,有人卖DeepSeek Reasoner,背后跑的却像普通DeepSeek Chat。让同一名船员使用不同的职业和构筑,可以产生完全不同的战斗风格。 而且这事之所以这么普遍,纯粹是经济结构决定的。发现这些可能性并使其发挥作用,会让玩家与角色之间产生共同的成就感,同时也加深了玩家对该船员的理解。 推理成本跟模型大小几乎线性挂钩,700亿参数和80亿参数的模型推理成本差五到十倍,中转站把你付费的大模型悄悄换成小模型或者量化到极致的版本,你在日常对话、翻译、简单问答这些场景下根本感知不出区别。我们还在继续扩展每个角色的故事和相关内容,让玩家有更多机会在战斗和成长之外,与他们的船员建立持久的联系。问: 玩家在远征期间的决策如何影响叙事和周围的世界?Alfie: 玩家在 Orbtopia 做出的决定会对城市及其居民产生切实的影响。比如你问今天天气怎么样,70B和8B给你的回答可能一模一样。例如,玩家可能会赶走某些人,甚至导致城市陷入衰落。而在海上的 Roguelike 航行中,决策更侧重于玩家如何发展自己的构筑。

| 不同的技能和能力组合会导致截然不同的结果,塑造每次航行的走向。 省下来的差价,就是纯利润。 只有在复杂推理、长文写作、代码这些场景下差距才会冒出来,但那时候钱已经交了。 所以如何来辨别中转站给你的API到底有没有掺水,或者看看你买的API,到底是不是一个真正对应模型的API,就成了刚需。 但问题在于,CISPA这套LLMmap的方法依然很重。问: 当 Sea of Remnants 明年发布时,你期待玩家会有什么反应?Alfie: 我们的目标是让玩家在游戏中找到快乐和娱乐,同时通过探索发现一个身临其境且真实可信的海洋世界。创造一个感觉真实且令人信服的世界对我们来说一直至关重要。Sea of Remnants 将于 2027 年登陆 Android、iOS、PC、PlayStation 5 和 Xbox Series X/S 平台。 你要准备专门的测试题,收集完整回答,建立模型数据库,还要训练分类器,一般人根本用不起来。

| 布鲁克纳真正牛逼的地方就在这里。 他把这套复杂的模型验明正身,压缩成了一件近乎荒诞的小事。 就问AI,给我一个随机数,然后数它的回答。 而且这个方法有一个特别精妙的地方,就是中转站拿它完全没办法。

| 传统的对抗性探针有个致命弱点,就是Prompt太特殊了,你发一条精心构造的、一看就不像正常对话的请求过去,中转站一旦发现你在探它,临时给你切成真模型就完了。 但“说一个1到100的随机数”这种话,放在任何聊天记录里都毫不起眼,跟你问天气预报没任何区别。 而且布鲁克纳的探测任务都是语义层面的,“说一个随机数”“说一个随机颜色”,这类问题可以用无穷多种方式改写、翻译,你用英文问和用阿拉伯语问测出来的是同一个模型的不同切面,但每个切面都带着它的身份信息。 他把这整套方法设计成了一个类似生物特征识别的协议,就类似于你用指纹解锁手机一样,先在可信的官方API上采集一份参考指纹,然后对你要验证的端点采集待验指纹,两份之间算一个Jensen-Shannon散度(衡量两个概率分布差多少的指标),距离小于阈值就认证通过。 用全部40个探测单元跑完,验证的准确率能到什么程度呢。 大概相当于,你拿两份指纹放在它面前,一份是真的一份是冒充的,它判断错误的概率只有7.3%,就算只用8个单元(也就是大概120条请求),错误率也只有10.6%左右。 这个跟上文我们提到的LLMmap的准确性已经差不多了,但是要简单太多了。 而且165个模型跑完以后,布鲁克纳发现了一个相当劲爆的案例。 一个叫Palmyra X5的端点,在OpenRouter上以某公司自研旗舰的身份售卖。 但它的行为指纹,跟通义千问的开源模型Qwen3-235B,几乎一模一样,差距只有0.141。

| 布鲁克纳的系统会给任意两个模型的指纹算一个相似度分数,数字越小代表越像。

| 同一个模型在两个不同供应商那里各部署一套,因为服务器环境不一样,两边的指纹也不会100%一致,这种自己跟自己比的正常波动大概是0.140。 Palmyra X5跟Qwen3-235B的差距是0.141,和一个模型自己跟自己比的波动几乎一模一样。

| 这下事情就非常的尴尬了。 布鲁克纳在论文里措辞很克制,说这只是统计性观察,不是对意图的指控。 但是,数据和代码全部公开,任何人都可以复现。 网址在此:https://zenodo.org/records/21278557 整套东西,非常有意思,而且不止数字,还有颜色等等等等,这个扩展性和上限,我觉得极高。 模型的随机并不随机,给了这种行为指纹非常值得探索的空间。 我觉得比审计结果本身更好玩的,是一个更底层的问题。 AI为什么就是不能生成真正的随机数。 之前帮影视飓风弄了个视频,就聊过这个话题,在AI视频里抛硬币,其实概率根本不是55开,是73开。 在这个布鲁克纳的测试里,也是一样的。 1到100的随机数这个任务的标准答案,所有人都知道,应该是均匀分布,100个数字每个被选中的概率严格1%。 但165个模型,一个都没做到。 论文里用了一个叫熵的指标来衡量回答到底有多随机,应该有无数人见过。

| 这玩意你可以简单理解成不可预测程度,数字越高代表越难猜,越接近真正的随机。如果1到100的分布是完全均匀的,熵应该是6.64 bit,也就是你几乎没法猜到下一个数字是什么。 但165个模型的中位数只有1.0 bit,差了五六倍。 AI回答随机数的时候,信息量只有真随机的六分之一,高度集中,高度可预测,高度非随机。 其实这个事,心理学和行为经济学研究了很多年。 不光AI,人类也不会生成随机数。 有一个经典实验,让一群人闭上眼睛说一串随机数字,结果呢,发现人类非常强烈的倾向避开重复、避开相邻数字、偏好奇数。

| 你让100个人说一个1到10的数,7被选中的概率远远高于10%,因为人脑觉得7看起来比较随机,而5和10看起来不够随机。 大家可以回想一下,自己是不是这样。 我们看到的绝大多数随机,可能只是隐藏因果关系在认知中的投影。 AI面临的是一模一样的困境,只不过原因不同。 真正的随机,要求你是一张白纸。

| 但大模型恰恰是人类有史以来造出来的信息密度最高的非白纸。 训练数据是数十万亿的token,几千年文明的总和。 每一个权重参数都编码着某种规律、某种偏好、某种从语料里沉淀下来的肌肉记忆。

| 所以你让它随便说一个数,它根本没法真正随便。

| 它只能从自己见过的所有文本里,找到一个最像随机数的答案。

| 42为什么被那么多模型偏爱? 因为它是《银河系漫游指南》里“生命、宇宙以及一切问题的终极答案”。

| 7为什么总被人类选中? 因为它在宗教、文化、文学和日常语言里,被反复赋予神秘、幸运和特殊的意义。 37、47、53这些数字为什么频繁出现? 因为它们是奇数,是质数,不圆整,不对称,看上去更像一个没有经过思考、随手蹦出来的数字。

| 可恰恰因为所有人都觉得它们更随机,它们才变得最不随机。 大模型只不过把人类潜意识里的这种偏见,压缩、放大,然后写进了自己的概率分布里。 我们总觉得模型是一个冷冰冰的数学机器,每次回答都来自概率采样,充满不确定性。 但当你把几十万次回答遍历回测,把那些看似随意的选择叠加在一起,你会发现它其实一点都不随意。 它们也有自己的偏爱,有自己的执念。

| 参数可以被量化,系统提示词可以被修改,名字可以被重新包装,外面甚至可以套上一层完全不同的壳。 可它在亿万次训练中形成的概率习惯,依然会从一个小小的Token里漏出来。

| 爱因斯坦说过,上帝不掷骰子。 而AI,也不掷骰子。 它每一次以为自己在掷骰子的时候。

| 掷出来的,都是自己。 >/ 作者:卡兹克。

|
Current article:http://www.zangjiwuqihuncongcherua.cyou/news/20260826_722.doc
Published on:16:50:14
主君的太阳TXT下载声明:
1 我的网站免费提供的主君的太阳,均由网友上传,供下载测试之用,不作商业用途,下载后请二十四小时后删除!
2 我们根据txt小说全文所整理出主君的太阳txt电子书全集免费下载,由程序自动生成主君的太阳txt下载文件。
3 书友所发表的txt小说主君的太阳的相关评论,并不代表本站赞同主君的太阳txt下载或者支持主君的太阳的读者观点。
4 如果发现小说《主君的太阳txt全集》无法下载未及时更新请联系我们。如果您喜欢主君的太阳txt电子书,请支持作者到书店购买正版图书。感谢您的合作与支持。
5 好看的小说主君的太阳是作者"百年不渡"的最新力作,主君的太阳电子书由网友发布;小说主君的太阳版权属于作者所有,如果侵犯您的利益,请通知我们。


















