36氪大模型4 小时前
Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差
摘要 · 文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐
阅读原文 · 36氪 →
大模型文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。 今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。 随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐
原文:https://36kr.com/p/3924826666301831?f=rss
0 条评论 · 观点来自社区X微博Telegram
评论区 0 条讨论