2026-06-22
按住下方图标,点击小程序
免费领取AI学习资料、精选提示词

今天早上, Sakana AI这家公司搞出来一个非常新的东西Sakana Fugu。
听这名字Fugu,河豚,就知道这公司挺有想法,没走寻常路。
而且还是一家日本AI公司确实挺稀有的,但一出手就挺狠性能直接追平Claude Fable 5。

体验:https://console.sakana.ai/login
这次他们不是又堆数据训练了个更大的巨无霸模型,而是换了个思路。搞出来的这个Fugu,本身是个语言模型,但最牛的地方不是自己懂多少,而是特别会来事。
被训练出来,是专门去调用其他各种顶尖AI模型的,就像一个经验老到的项目主管,知道什么时候该用哪个专家,怎么把大家的力量合到一块儿去解决难题。
你只需要通过一个简单的API给AI下指令,就在后台把那些复杂的调度工作全给你办了。
为啥非要搞个AI领导出来
你可能会想,这不是多此一举吗?我直接找个最强的模型不就行了?
问题就在于,现实里的活,尤其是那种需要动点脑筋的,通常都特别杂。比方说你想做个市场分析,既要查数据,又要写代码处理,还得生成图表,最后用漂亮的文字总结出来。
有一个单一的模型能把所有活都干得漂亮。有的模型逻辑强,有的文笔好,有的擅长处理表格。
Sakana AI还看到了另一个很现实的问题,就是鸡蛋不能放在一个篮子里。
现在很多公司和开发者都重度依赖某一家AI公司提供的模型,万一这家公司因为政策调整、出口管制或者别的什么原因,突然不给你用了,或者涨价涨得离谱,那你整个业务可能就瘫痪了。
前阵子Anthropic的Claude Fable 5刚发布就被限制使用就是个活生生的例子。
Sakana AI的这个思路就灵活多了,底下的专家团队是可以随时换的。如果今天OpenAI的模型用着不顺手,明天它就可以无缝切换到谷歌的或者别的开源模型上,对你这个最终用户来说,几乎感觉不到变化。

说到这我得插一嘴,Fugu背后其实有两篇硬核论文撑着,都发在了ICLR 2026上,一个叫Trinity,一个叫Conductor。
Trinity这套机制挺巧妙,会给不同的模型分配角色,有负责思考的Thinker,有负责干活的Worker,还有负责检查的Verifier,三个角色互相配合,把复杂的任务拆解得明明白白。
Conductor则更进一步,用强化学习让模型自己摸索出怎么用自然语言去协调其他模型,而不是靠人手工写死规则。
也就是说,Fugu怎么调度、怎么分工,不是程序员一行行代码教出来的,是AI自己学出来的。
两个版本,性能超强
这次他们推出了两个版本,一个是咱们开头说到的Fugu,另外一个是Fugu Ultra。
简单来说,Fugu就是个标准版,反应速度快,适合处理日常大部分工作,比如帮你看看代码有没有bug,或者当个高级点的聊天助手。
而Fugu Ultra就是个豪华版,它更沉得住气,会调动更多更专业的专家模型,专门去啃那些硬骨头,比如做前沿的AI研究、复现复杂的论文结果、做深度的网络安全渗透测试这些。
官方放出的数据也挺能打。在SWE Bench Pro这个行业公认的硬核编程测试里,Fugu Ultra拿下了73.7分,直接超过了Opus 4.8的69.2和GPT 5.5的58.6。

在LiveCodeBench Pro上更是干到了90.8分,把一众对手甩在身后。

还有个叫Humanity's Last Exam的测试,专门考模型的知识广度和推理深度,Fugu Ultra得了50.0分,比Claude Fable 5的53.3少了一点点而已。

登录/注册后继续阅读
立即登录/注册 >