多个国产模型联合,就能挑战Claude Fable 5?

当单一模型性能见顶,OpenRouter用多模型聚合给出新解法:Gemini 3 Flash、Kimi K2.6与DeepSeek V4 Pro组合后,由顶级模型综述,成本减半却逼近Claude Fable 5。国产开源模型能否借这种“拼装”思路动摇海外顶级模型的性能优势?

2026年6月27日 · 1333 字  · 张翼轸

Deepseek专用CodeAgent为什么不是蹭热点

Deepseek V4 发布后,专用 CodeAgent 层出不穷,有人说这是蹭热点,但我觉得在官方 Harness 落地前,它们是重要补完。V4 的小毛病会拖累工具调用,自动修复能拉回下限,Model 加 Harness 或许正成为标配。

2026年5月28日 · 1405 字  · 张翼轸

用大模型写SVG,也许是个糟糕的主意

长期用大模型生成SVG配图,直到给娃做钟面教具时才发现,时针分针会重叠、微调费劲。改用HTML+Canvas后,连便宜模型都能稳定出图,问题究竟出在模型,还是SVG本身?

2026年5月8日 · 1522 字  · 张翼轸

Qwen 3.6 Flash的视觉理解能力强得有点离谱

一张没有等第的默写纸,让多模态模型暴露幻觉:Qwen 3.6 Flash能识别日期并指出没有等第,成本仅0.017元;小米、Gemini与GPT却脑补出等第。提示词能纠偏,但模型何时不再依赖技巧?

2026年5月5日 · 662 字  · 张翼轸

Deepseek V4对存储、光模块需求的打击尚待显现

Deepseek V4看似缺少跑分惊喜,0.8%的缓存命中价格却指向KV Cache压缩和推理成本重构。若这套架构被更多模型采纳,HBM、存储、光模块与国产算卡的需求逻辑或将生变,影响尚待显现。

2026年5月2日 · 2032 字  · 张翼轸

当你用AI帮娃做手工,多模态能力的差距体现了

一张纸盒小猫图纸,要转成可打印SVG,Gemini 3.1 Pro一次生成刀模图,国产模型和Claude、Grok却接连在比例与结构上失手。多模态空间理解与工程可用性的差距,被一件亲子手工摆到台前。

2026年4月30日 · 591 字  · 张翼轸

Workbuddy还没接住Deepseek V4溢出的厚爱

CodeBuddy因Deepseek V4发布会被意外提及而受关注,但同门的办公Agent WorkBuddy却没能接住这波红利。内置模型仍停留在Deepseek V3.2,手动接入V4 Flash后,工具调用很快触发reasoning_content回传报错,而OpenClaw等产品当天就修复了。国产模型跑得快,Agent基建跟不跟得上,才是真问题。

2026年4月28日 · 1125 字  · 张翼轸

Qwen 3.6最让我惊喜的还是多模态的Flash

Qwen 3.6 Flash的定位并不简单:它其实是Qwen3.6-35B-A3B的马甲,输出价却来到百万token 7.2元。实测作文和发票识别后,速度快、单次成本低,国产多模态的可用性可能被重新评估。

2026年4月28日 · 1287 字  · 张翼轸

Deepseek V4 Flash是沉浸式翻译的绝配

顶级模型未必适合所有场景,沉浸式翻译真正需要的是低价与速度。Deepseek V4 Flash以够用响应和远低于Gemini Flash Lite成本,卡进被忽视的生态位,它会成为你用完就忘的工具吗?

2026年4月26日 · 1161 字  · 张翼轸

Qwen需要超大杯

Qwen3.6-Max-Preview性能登顶国产模型,价格却未披露;更值得琢磨的是,Plus涨价后已贵过Max,原有档位逐渐失序。当性能逼近御三家主力,Max会如何定价、Qwen又能否给出一套可预期的命名与价格逻辑。

2026年4月20日 · 1360 字  · 张翼轸
· SVGArena · 大模型谄媚榜单 · 给少数人的基金投资书