最近在几个国产模型之间来回切换,体感差异比跑分有趣得多。有些模型写代码像老员工,有些像刚喝完三杯咖啡的实习生……
真正拉开差距的不是单次回答质量,而是长上下文里的稳定性,以及工具调用失败时的恢复策略。
下一篇打算聊聊 agent 框架的记忆分层设计,先把坑占上。