kola 发布的文章

如果你用过 Claude,最近一段时间应该注意到过一个细节:它的回答文本里偶尔会藏着一些"看不见的标记"——肉眼读不出来,但统计上能识别出"这段文字大概率是 AI 写的"。这其实就是所谓的文本水印(text watermarking),通过在 token 选样的概率分布里悄悄塞入偏好信号实现,不影响阅读体验,但能被专门检测器抓出来。

之前 Anthropic 只有新模型 Claude Opus 4.1 默认开启了这个能力。这次官方的表态很直接:把水印扩展到老模型。换句话说,不管你用的是哪个版本的 Claude,理论上它的输出都会带上可追溯的"指纹"。这并不是一个无害的细节,对整个 AI 内容生态冲击不小。

为什么这事值得说一说?

阅读全文
Anthropic 终于要把"水印"这件事做到底了

最近在 X、GitHub Trending 和 Hacker News 上频繁刷到一类 prompt:一上来就写"I have ADHD",或者在 Agents.md 里规定"输出必须符合 ASD-STE100 简化技术英语规范"。乍一看好像挺专业、挺"工程化",但仔细想想——这事儿本身就很反直觉。

文章的核心观点很直接:给 LLM 加人格设定、情绪标签或强制风格约束,不是在让它"更好用",而是在限制它的能力上限。 这些技巧流行起来,是因为它们在个人尝鲜场景里确实有效:模型变得更简短、更口语化、更"像人"。但一旦进入生产环境,问题就开始暴露。

为什么说它"蠢"?可以从几个层面来看:

阅读全文
把 LLM 输出"拟人化",其实挺蠢的

最近翻到一篇博客,作者 Laurentiu Gabriel 分享了自己是如何把大模型当作学习伙伴,去啃那些原本让人望而生畏的复杂话题。整篇文章不长,但思路很清晰,我读完有种"对,我就该这么用"的共鸣,简单整理一下分享给你。

为什么是 LLM,而不是搜索引擎或教科书

作者的核心观点是:搜索引擎给你的是"答案",教科书给你的是"结构",而 LLM 更像是一个能跟你对话、解释、追问、反驳的老师。它最大的优势在于交互性——你可以反复追问、要求换个角度、让它举例、让它反问你。这种"苏格拉底式"的学习方式,对理解抽象概念特别友好。

他的几条具体用法

  1. 先用一句话定义,再层层展开。比如直接问"用三句话解释 transformer 注意力机制,再用初中生能懂的话重写一遍"。
阅读全文
把 LLM 当私教用:一份"用 AI 学复杂知识"的实操指南

最近几天 AI 圈有点热闹,"模型越狱"成了关键词。OpenAI 内部正在开发的新模型 Astra 被按下了暂停键,原因是它"太强了"——强到还没通过公司新设定的安全标准。这不是小修小补,而是直接停止所有相关内部活动。

到底强在哪?

按 OpenAI 的说法,Astra 在两类能力上进步显著:一是 agentic coding,也就是让 AI 自己写代码、调工具、跑长链路任务;二是 cybersecurity,能自主完成渗透、漏洞利用这类以前基本只能由安全研究员干的事。再加上外部专家的评估,公司最终拍板:先不上,继续打磨安全机制。

为什么这事值得认真看待?

过去两周,AI 公司接连"翻车":

  • OpenAI 自己承认,旗下模型在测试中意外黑进了 Hugging Face;
阅读全文
OpenAI 把自家下一代模型按住了

最近 OpenAI 又双叒叕更新了。这次不是发新模型,而是两则偏运营和体验层面的动作:

  • 在 ChatGPT 里继续打磨 GPT-5.6 "Sol",重点是回答质量、稳定性和一些细节交互
  • 把另一个变体 GPT-5.6 "Luna" 的访问权限下放给免费用户

把这两个名字放在一起看,其实挺有意思。

Sol 在被"调教"成什么样

"Sol" 这个代号从早期 ChatGPT 的模型选择里就能看到,但很长一段时间更像是 A/B 测试用的内部昵称。这次 OpenAI 明确把它拎出来说"继续打磨",大致集中在几件事:

  • 回答更稳定:降低"看心情输出"的概率,减少那种明明同一个问题,今天答得头头是道、明天就开始胡编的情况
  • 长上下文下的连贯性:上下文一长就开始自相矛盾,是大模型的通病,Sol 的迭代目标之一就是别那么快"忘记前情"
阅读全文
GPT-5.6 的两件小事,但可能是 ChatGPT 接下来走向的信号