三大LLM同台竞技写博客
这三篇博客都是AI agents写的. 但是提示词是我写的, 也就是我在三大LLM之间搭了一个赛场, 让它们互相竞争写博客. 这三篇博客都是同一个提示词, 但是不同的LLM写出来的风格和内容都不一样. 你可以看看哪一篇更符合你的口味.
三个平台基本上都是用的中端模型, 因为我没有ChatGPT订阅, 只能用Github教育优惠里面的最好的ChatGPT模型, 也就是ChatGPT 5.6 Luna.
- Claude用的是Claude 5 Sonnet. 它写的文章: Token杯AI国际象棋大赛-Claude
- ChatGPT用的是ChatGPT 5.6 Luna. 它写的文章: Token杯AI国际象棋大赛-ChatGPT
- Gemini用的是Gemini 3.6 Flash. 它写的文章: Token杯AI国际象棋大赛-Gemini
提示词
我最近开发了一个TokenCup AI国际象棋竞赛平台. 让大语言模型之间互相下棋. 你能不能帮我写一篇博客, 来记录这件事. 我已经把框架搭好了. 在~dev/blog/_posts/2026/2026-08-10-Token杯AI国际象棋大赛-[agent].md 你就写你自己的, 不要偷看别人的, 也不要动别人的.
几个要点:
- 你可以阅读我的其它博客文章, 尤其是近几年的博客, 熟悉我的写作风格.
- 平台本身的代码在~/dev/tokencup里, 你可以查看代码了解系统本身,查看git log来理解系统开发过程, 基本上都是Claude写的. 创意是我.
- 数据存在数据库里, 数据库的访问方式在~/dev/tokencup/backend/config.toml配置文件里面,你可以查看数据库, 里面有所有的对决记录和结果
- 我希望的博客风格是比较风趣幽默, 计算机专业的内容尽可能少, 否则大众看不懂.
大概的提纲:
- Token自由 之前一直没有AI订阅, 所以都是自己拿L4, DGX Spark搭本地模型, 但是这样的模型Size都不大, 智能也有限. 最近突然Token自由了. 因为:
- GitHub的教育优惠通过了. 有15美元, 可以用Copilot Pro.
- 买了Google Gemini Pro, 因为谦要用Gemini NoteBook. 谷歌的AI, Harness AntiGravity跟网页版的额度是分开算的. 所以我们各用各的互不干涉.
- 学校给买了Claude Max, 用量很足.
- 自己还冲了10块钱的OpenCode Go套餐. 可以用各种Open Weight模型
- 打通壁垒 最近用了Herdr, 这个软件号称Agent时代的Tmux, 后来我发现它可以允许很简单的在不同的Agent之间可以互相发消息通讯. 这就有意思了. Agent之间通讯很有意思, 一个例子: 我让它访问一个网站,结果网址打错了, 它自然打不开. 然后它居然跟人类一样, 跟别的Agent说, 我这个网站怎么打不开啊, 你帮我试试?
但Agent通信之后能看啥呢, 我想到一个简单有意思的功能呢, 让他们之间通信下棋. 所以一共三个模型, 一个裁判, 两个参赛选手. 裁判模型不用很强大, 免费的模型都可以.
天昏地暗 周六一天Agents都在杀得天昏地暗. 我发现: OpenCode里面免费的模型的确水平有限, 可能很多都是中国模型, 中国象棋还不错, 国际象棋不太行. Gemini居然可以大杀四方. 为了防止大语言模型thinking个没完. 我想告诉它, 你每回个thinking不能超过三分钟. 但是这些语言模型没有时间概念. 譬如让他们每一秒种说一个字, 它做不到.
重新发明轮子 学软件这么多年, 最重要的箴言之一就是 “不要重新发明轮子”, 后来我发现我就是重新发明轮子, 因为让LLM下棋早就别人干过了. (https://maxim-saplin.github.io/llm_chess/), 而且结果跟我花了这么多Token之后得出的结论是差不多的. 总体而言, 所有的模型水平就在Class C player水平上下. 你作为真人, 很容易发现他们有一些莫名其妙的棋路. 因为随着棋路变长, Thinking的难度加大. 跟AlphaZero, StockFish差得狠.
几张图片, 把他们加入博客合适的地方.
uploads/2026/tokencup/GUI.png TokenCup界面 uploads/2026/tokencup/InfiniteThinking.png ChatGPT似乎陷入了无尽循环, 我的钱包在燃烧 uploads/2026/tokencup/judge.png 裁判通过herdr给选手发消息 uploads/2026/tokencup/leaderboard.png LLM Chess的Leaderboard
写完之后麻烦你帮我再翻译成英文, 跟其它现有博客一样. 保持中英文都有一篇.
修正版
这篇博客是你帮我写的, 我发现了几个问题, 帮我纠正一下:
- herdr的正确官网是https://herdr.dev
- L4 GPU不是我自己的, 也是学校的一台虚拟机里的.
- 天昏地暗 一节, 其实还有一个发现, 我忘了: 模型的Context Window就是模型的“斩杀线”, 那些1M的模型thinking再多一局棋基本不会满.但是对于那些200K的模型, 一旦Context Window快满了触发了compaction, 智商就显著降低, 然后很容易就输了. 不知道为什么, 裁判每一步的提示词都把所有之前所有步骤都发给模型了, 按理说它可以还原出整个棋局. 请纠正他们, 并且同步更新英文博客. 谢谢.