刚刚过去的这一周对中国人工智能行业无疑是非常重要的一周,一个是在上海举办的世界人工智能大会 WAIC引起了世界广泛关注,总书记还去 WAIC 发表了重要讲话。另外一个就是月之暗面发布了引起国内外关注的具备这2.8T 参数的大模型 Kimi K3,Kimi K3应该是目前开源大模型参数最多,并且评测最接近顶级闭源模型Fable 5和 Open AI 5.6的开源模型。而Kimi发布的第二天,美国股市下挫,因此雅虎财经还发了文章,说 Kimi K3 的发布打击了美国股市,AI 泡沫可能会破碎。

由于我们公司目前的工作重度依赖 Claude Code和 Codex,公司的主力产品以及正在研发的新一代AI B2B营销增长系统也非常依赖先进模型的能力,看到 Kimi K3的发布,我自然需要体验一下,看看能否用Kimi K3来解决我们的问题,得到一个性价比更好的选择。当然,因为 Claude的各种骚操作,也为未来万一CC 被封,能够有个更好的选择。
Kimi现在有四档套餐,分别是 Andante, Moderato, Allegretto, Allegro。Kimi的这几档取名挺有意思,分别是音乐速度中的行板、中班、小快板、快板。

由于不知道 Kimi的用量速度,我最先订阅了 99 人民币一个月的 Moderato,下载了Kimi Cli,然后用南川同学独立开发的Yoda来进行调用,正好为将来使用多个编程 Agent 做准备(小小期待一下 DeepSeek V4正式版)。
任务一 – SEO 诊断
安装好之后,我首先没有使用 K3,而是使用 K 2.7 调用我们内部的诊断 Agent做了一下我自己运营的一个 B2B网站的 SEO 诊断。

初次体验,2.7 运行的速度不错,由于 SEO 诊断更多的依赖我们很多tool和 mcp,中间需要推理的过程不多,所以产出的报告质量还不错。
任务二 – 博客写作
接下来就是一个相对复杂的工作,我们把我们写作博客的所有 skills做成了可以适配不同模型的智能体,方便我们能够随时优化这些 skill,再把优化好的 skill 上线到生产环境中服务我们的客户。我这个新的任务就是让 Kimi K3来用我们的博客写作智能体来创作QuickCreator的博客。这个project过去一直是用 CC 在运行,现在直接让 Kimi读取项目目录,接力 CC 进行博客创作。

实际执行下来,K3 能够很好的理解当前项目的进展,读取了progress.md并且正确理解了content plan,能够调用我们的工具去进行内容获取,然后整个流程都能顺利进行,写出来的文章质量也不错。但是对比 CC,有如下两个缺点:
- 不能调用浏览器去截屏,在写作alternative文章的时候,我的智能体需要去对每个软件进行截屏,但是Kimi告诉我截图代理没开,不能截图。
- 执行速度慢,在用 CC 的时候,我一篇文章创作完通常在 10-15 分钟,但是用 Kimi 一篇文章接近半个小时。
任务三 – 从头构建一个B2B网站
接下来这个任务则是一个相对比较复杂的任务,我们从今年 3 月份开始内部迭代一套利用 Skill和智能体,能够构建一个具备上线标准的符合海外营销增长需求的 B2B营销云盘占。
在这套系统中,我们开发了上百个skill,并且把建站过程分成了不同的阶段。在不同阶段有不同的skill和agent被调用,并且在不同阶段都有不同的硬约束和退出条件。
为了验证 K3 的能力,我用正在建设的一个客户的网站的素材做为原始输入,方便我进行对比。由于 Moderato的额度实在有限,很快就会被消耗光,我升级到了 Allegretto来完成我的建站工作。
整个工作从7 月 18 日下午开始,持续到周日晚上我写这篇文章开始。目前完成了首页设计,正在进行首页构建。
到了任务三,Kimi K3相比 Claude Code还是有些不足,我现在 CC 主要是用 Opus 4.8。其中最明显的问题就是速度慢,并且 token 消耗比较快。截止到写这篇文章的时候,我遇到了 3 次 30 分钟超时,每次超时都是Kimi的Agent去花大量时间和token去理解文档,我不知道为什么。

同样的任务,在 CC 应该早就跑完了,但是在 Kimi这里我还不知道什么时候跑完。跑到现在,我已经用了周用量的 42%,看起来似乎只有 699 一个月的最高套餐才行。

让我看看跑完这一步,最终用量会是多少。
总结一下
作为参数最大的开源模型,Kimi K3已经具备了不错的推理和编程能力。对于一些日常工作,除了速度问题,已经能够平替海外的闭源模型。另外,Kimi 具备了多模态能力,由于我们建站需要去读取一些优秀网站的设计,所以这点儿对我们非常关键。但是对于一个复杂的智能体系统,Kimi目前速度比较慢,不知道什么原因会莫名奇妙的在一个不应该的环节执行很长时间,相比海外顶尖模型还是有不小差距。毕竟,时间效率也是非常重要的。据说下周 DeepSeek V4 Pro正式版会发布,到时候看看 DeepSeek V4的体验如何。
来源公众号: 老阎杂货铺(ID:gh_59d2a9b32af1)分享一些个人的技术的研究。
本文由 @老阎杂货铺 原创发布于奇赞平台,未经许可,禁止转载、采集。
该文观点仅代表作者本人,奇赞平台仅提供信息存储空间服务。

