Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

摘要 · 文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐
阅读原文 · 36氪
Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差大模型

文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐

原文:https://36kr.com/p/3924826666301831?f=rss

0 条评论 · 观点来自社区

评论区 0 条讨论

的身份发言⌘/Ctrl+Enter 发送
还没有评论,来抢沙发。