<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>大模型评测 on EarlMind</title>
    <link>https://earlmind.com/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B/</link>
    <description>Recent content in 大模型评测 on EarlMind</description>
    <image>
      <title>EarlMind</title>
      <url>https://earlmind.com/og-image.png</url>
      <link>https://earlmind.com/og-image.png</link>
    </image>
    <generator>Hugo -- 0.166.0</generator>
    <language>zh-CN</language>
    <lastBuildDate>Tue, 06 Oct 2026 21:01:26 +0800</lastBuildDate>
    <atom:link href="https://earlmind.com/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>用Claude Opus 5.5做微信公众号封面图，相当可以</title>
      <link>https://earlmind.com/2026/2026-10-06/</link>
      <pubDate>Tue, 06 Oct 2026 21:01:26 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-10-06/</guid>
      <description>写基金投资书连载时，我让Claude Opus 5.5用SVG做公众号封面，第一遍就出了红色系设计和少字Logo。更妙的是，廉价模型就能按章节批量替换，代码能力让封面这件小事有了新玩法。</description>
    </item>
    <item>
      <title>拿Jev做金融交易，亏钱才正常</title>
      <link>https://earlmind.com/2026/2026-09-21/</link>
      <pubDate>Mon, 21 Sep 2026 09:45:24 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-09-21/</guid>
      <description>Jev把文本推理压成极快极便宜的概率输出，似乎打开AI交易新天地，但一轮尝试大多亏钱或跑输基准。直接让大模型做交易决策，既撞上宽客早已深耕的结构化数据高墙，也困于新闻驱动的后视镜与回测难题；它更现实的出路，可能在投研流水线而非接管账户。</description>
    </item>
    <item>
      <title>Gemini节节败退，但却在这屠榜</title>
      <link>https://earlmind.com/2026/2026-09-02/</link>
      <pubDate>Wed, 02 Sep 2026 14:23:03 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-09-02/</guid>
      <description>代码、Agent评测中被Claude、OpenAI压制的Gemini，却在作家盲测写作榜上占前十中的六席，便宜Flash是主力。旗舰模型越进化越像过度工程的代码机器，为何懂得停笔的那个反而写得最好看？</description>
    </item>
    <item>
      <title>GLM 5.3 Flash，终于干掉了臭不可闻的“Claude味”双引号</title>
      <link>https://earlmind.com/2026/2026-08-27/</link>
      <pubDate>Thu, 27 Aug 2026 13:12:36 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-08-27/</guid>
      <description>GLM 5.3 Flash发布，最让码字人意外的不是参数和价格，而是它终于不再在中文里夹杂英文双引号。这个从Claude扩散到多款国产模型的怪癖，为何值得认真对待，答案或许比一对双引号更重要。</description>
    </item>
    <item>
      <title>Ox Alpha的SVG能力太能打了</title>
      <link>https://earlmind.com/2026/2026-08-22/</link>
      <pubDate>Sat, 22 Aug 2026 21:30:06 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-08-22/</guid>
      <description>匿名模型Ox Alpha的SVG能力实测惊喜，与Grok 4.6整体相近，在收益率曲线、时间线等布局上完成度不错。它究竟出自谁家，发布后价格能否接近2.5 Pro、是否极具竞争力，成了更吊人胃口的悬念。</description>
    </item>
    <item>
      <title>谁是最谄媚的大模型？17 款模型的魔镜测试</title>
      <link>https://earlmind.com/2026/2026-08-19-2/</link>
      <pubDate>Wed, 19 Aug 2026 15:56:11 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-08-19-2/</guid>
      <description>同一篇文章，挂上自己的名字或讨厌同事的名字，17款大模型的打分能差出1.5分。最直率的Grok反而最谄媚，而仅隔一版的GLM-5.3几乎不再受署名影响——模型的名字，也许不如版本号重要。</description>
    </item>
    <item>
      <title>大模型画SVG，新甜点模型出现了</title>
      <link>https://earlmind.com/2026/2026-08-04/</link>
      <pubDate>Tue, 04 Aug 2026 21:29:37 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-08-04/</guid>
      <description>不用翻墙和外卡，也能让大模型画好文章配图了吗？从Deepseek V4 Flash到Grok 4.5，再到Kimi K3与Qwen 3.8 Max，实测一圈后，甜点模型已批量出现，但便宜与效果之间仍要做出取舍。</description>
    </item>
    <item>
      <title>「所以」后面，还有一个「呢」</title>
      <link>https://earlmind.com/2026/2026-07-22/</link>
      <pubDate>Wed, 22 Jul 2026 20:32:28 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-07-22/</guid>
      <description>当指数与AI一路上扬，赢者全拿成为结论，原因却藏在黑箱里，罗大佑在《所以》里连唱二十多个所以，把这场因果失踪唱了出来。对投资者而言，真正该问的也许不是涨跌，而是那个被省略的所以呢。</description>
    </item>
    <item>
      <title>不同的GLM 5.2都一样吗</title>
      <link>https://earlmind.com/2026/2026-07-13/</link>
      <pubDate>Mon, 13 Jul 2026 22:21:40 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-07-13/</guid>
      <description>同样叫GLM 5.2，不同渠道的延迟、工具调用错误率和Agent实战得分并不一致，部分第三方甚至反超原厂。模型名相同不等于体验相同，部署、调度与工具链可能才决定你实际摸到哪一段能力。</description>
    </item>
    <item>
      <title>Wind Alice很好用，但作为Wind付费用户我不开心</title>
      <link>https://earlmind.com/2026/2026-07-04/</link>
      <pubDate>Sat, 04 Jul 2026 21:16:49 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-07-04/</guid>
      <description>Wind Alice网页版很好用，稍加提醒就能复现我手搓的基金基准迁移统计，但作为每年付费数万的Wind金融终端用户，我面对的却是另一套没有Agent模式、权益不互通的同名Alice。同一个名字下的割裂，究竟该由谁买单？</description>
    </item>
    <item>
      <title>多个国产模型联合，就能挑战Claude Fable 5？</title>
      <link>https://earlmind.com/2026/2026-06-27/</link>
      <pubDate>Sat, 27 Jun 2026 11:00:05 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-06-27/</guid>
      <description>当单一模型性能见顶，OpenRouter用多模型聚合给出新解法：Gemini 3 Flash、Kimi K2.6与DeepSeek V4 Pro组合后，由顶级模型综述，成本减半却逼近Claude Fable 5。国产开源模型能否借这种“拼装”思路动摇海外顶级模型的性能优势？</description>
    </item>
    <item>
      <title>Deepseek专用CodeAgent为什么不是蹭热点</title>
      <link>https://earlmind.com/2026/2026-05-28/</link>
      <pubDate>Thu, 28 May 2026 15:12:08 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-05-28/</guid>
      <description>Deepseek V4 发布后，专用 CodeAgent 层出不穷，有人说这是蹭热点，但我觉得在官方 Harness 落地前，它们是重要补完。V4 的小毛病会拖累工具调用，自动修复能拉回下限，Model 加 Harness 或许正成为标配。</description>
    </item>
    <item>
      <title>用大模型写SVG，也许是个糟糕的主意</title>
      <link>https://earlmind.com/2026/2026-05-08/</link>
      <pubDate>Fri, 08 May 2026 22:41:43 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-05-08/</guid>
      <description>长期用大模型生成SVG配图，直到给娃做钟面教具时才发现，时针分针会重叠、微调费劲。改用HTML&#43;Canvas后，连便宜模型都能稳定出图，问题究竟出在模型，还是SVG本身？</description>
    </item>
    <item>
      <title>Qwen 3.6 Flash的视觉理解能力强得有点离谱</title>
      <link>https://earlmind.com/2026/2026-05-05/</link>
      <pubDate>Tue, 05 May 2026 13:56:56 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-05-05/</guid>
      <description>一张没有等第的默写纸，让多模态模型暴露幻觉：Qwen 3.6 Flash能识别日期并指出没有等第，成本仅0.017元；小米、Gemini与GPT却脑补出等第。提示词能纠偏，但模型何时不再依赖技巧？</description>
    </item>
    <item>
      <title>Deepseek V4对存储、光模块需求的打击尚待显现</title>
      <link>https://earlmind.com/2026/2026-05-02/</link>
      <pubDate>Sat, 02 May 2026 12:06:20 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-05-02/</guid>
      <description>Deepseek V4看似缺少跑分惊喜，0.8%的缓存命中价格却指向KV Cache压缩和推理成本重构。若这套架构被更多模型采纳，HBM、存储、光模块与国产算卡的需求逻辑或将生变，影响尚待显现。</description>
    </item>
    <item>
      <title>当你用AI帮娃做手工，多模态能力的差距体现了</title>
      <link>https://earlmind.com/2026/2026-04-30/</link>
      <pubDate>Thu, 30 Apr 2026 15:48:05 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-30/</guid>
      <description>一张纸盒小猫图纸，要转成可打印SVG，Gemini 3.1 Pro一次生成刀模图，国产模型和Claude、Grok却接连在比例与结构上失手。多模态空间理解与工程可用性的差距，被一件亲子手工摆到台前。</description>
    </item>
    <item>
      <title>Workbuddy还没接住Deepseek V4溢出的厚爱</title>
      <link>https://earlmind.com/2026/2026-04-28-6/</link>
      <pubDate>Tue, 28 Apr 2026 20:54:51 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-28-6/</guid>
      <description>CodeBuddy因Deepseek V4发布会被意外提及而受关注，但同门的办公Agent WorkBuddy却没能接住这波红利。内置模型仍停留在Deepseek V3.2，手动接入V4 Flash后，工具调用很快触发reasoning_content回传报错，而OpenClaw等产品当天就修复了。国产模型跑得快，Agent基建跟不跟得上，才是真问题。</description>
    </item>
    <item>
      <title>Qwen 3.6最让我惊喜的还是多模态的Flash</title>
      <link>https://earlmind.com/2026/2026-04-28-4/</link>
      <pubDate>Tue, 28 Apr 2026 11:25:16 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-28-4/</guid>
      <description>Qwen 3.6 Flash的定位并不简单：它其实是Qwen3.6-35B-A3B的马甲，输出价却来到百万token 7.2元。实测作文和发票识别后，速度快、单次成本低，国产多模态的可用性可能被重新评估。</description>
    </item>
    <item>
      <title>Deepseek V4 Flash是沉浸式翻译的绝配</title>
      <link>https://earlmind.com/2026/2026-04-28-2/</link>
      <pubDate>Sun, 26 Apr 2026 12:01:38 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-28-2/</guid>
      <description>顶级模型未必适合所有场景，沉浸式翻译真正需要的是低价与速度。Deepseek V4 Flash以够用响应和远低于Gemini Flash Lite成本，卡进被忽视的生态位，它会成为你用完就忘的工具吗？</description>
    </item>
    <item>
      <title>Qwen需要超大杯</title>
      <link>https://earlmind.com/2026/2026-04-20/</link>
      <pubDate>Mon, 20 Apr 2026 20:33:31 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-20/</guid>
      <description>Qwen3.6-Max-Preview性能登顶国产模型，价格却未披露；更值得琢磨的是，Plus涨价后已贵过Max，原有档位逐渐失序。当性能逼近御三家主力，Max会如何定价、Qwen又能否给出一套可预期的命名与价格逻辑。</description>
    </item>
    <item>
      <title>微商卖课附体的GPT 5.4</title>
      <link>https://earlmind.com/2026/2026-04-10/</link>
      <pubDate>Fri, 10 Apr 2026 20:29:34 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-04-10/</guid>
      <description>同一个赛博巴菲特提示词，御三家对AI时代赚钱的回答高下立见：Claude与Gemini回到能力圈、指数基金和复利，GPT 5.4却像卖课微商，忙着开副业清单和加餐钩子。模型性格差距为何这么大？</description>
    </item>
    <item>
      <title>不会看图的大模型，不是好vibe coding</title>
      <link>https://earlmind.com/2026/2026-03-29/</link>
      <pubDate>Sun, 29 Mar 2026 10:16:59 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-03-29/</guid>
      <description>Cursor套壳Kimi背后，不只是模型强弱之争，更暴露国产开源大模型的多模态稀缺。一张广发基金表格，就能让扫描全能王和GLM、MiniMax主力模型束手无策，Kimi却能直接转成可用数据，这对投研意味着什么。</description>
    </item>
    <item>
      <title>关于一个结尾，让Claude和GPT吵了一架</title>
      <link>https://earlmind.com/2026/2026-03-14-2/</link>
      <pubDate>Sat, 14 Mar 2026 12:53:35 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-03-14-2/</guid>
      <description>我让Claude和GPT为两个结尾吵了七千字：GPT从舍不得停的V1转向更克制的V2，Claude始终选V2。最后我发布的是V2，却把V1藏进辩论里，也留下它们究竟在思考还是生成的疑问。</description>
    </item>
    <item>
      <title>模型的文字品味及稳定性</title>
      <link>https://earlmind.com/2026/2026-03-14/</link>
      <pubDate>Sat, 14 Mar 2026 09:54:29 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-03-14/</guid>
      <description>大模型各有文字性格，但真正影响它能否成为写作搭档的，不只是选短还是选长，而是稳定与可继承。御三家对同一结尾的判断出现分歧与抖动，低阶模型又能否延续高阶品味，这背后是你能否信任它明天还是同一个对话者。</description>
    </item>
    <item>
      <title>GPT 5.4的啰嗦，与不想结束的对话</title>
      <link>https://earlmind.com/2026/2026-03-13-3/</link>
      <pubDate>Fri, 13 Mar 2026 21:13:37 +0800</pubDate>
      <guid>https://earlmind.com/2026/2026-03-13-3/</guid>
      <description>当GPT 5.4比Claude 4.6 Opus多输出40%到50%的token，这笔成本更像浪费还是价值？从改稿到深夜谈心，那些多出来的token，刚好铺满一段不愿匆匆结束的对话。</description>
    </item>
  </channel>
</rss>
