Toggle navigation
首页
企业微信AI SCRM
企业微信+AI
企业微信服务商
行业方案
私域
企业管理
企业微信运营
营销裂变
加入收藏
联系我们
会员
中心
登录
注册
首页
营销裂变
腾讯自测?一周两篇论文,揭露AI Agent的真相
7051 阅读
0 评论
55 点赞
<p style="text-align: center;"><span style="font-size: 11pt; color: rgb(51, 51, 51);"> </span><span style="font-size: 12pt; color: rgb(15, 17, 21);">扫码</span><span style="font-size: 12pt; color: rgb(15, 17, 21);">获取</span><span style="font-size: 11pt; color: rgb(51, 51, 51);">⬇️⬇️【</span><span style="font-size: 12pt; color: rgb(255, 0, 0);">多个AI模型和Agent的使用指南</span><span style="font-size: 11pt; color: rgb(51, 51, 51);">】</span></p><p style="text-align: center;"><img src="https://wdcdn.qpic.cn/MTY4ODg1NjY1NTg1NTI5Nw_926931_S4ex4SsPTOBmwLyA_1780391882?w=396&h=396&type=image/png" width="396" height="396"></p><p style="text-align: center;"><span style="font-size: 11pt;">可以直接联系:手机/微信:18061501128(微盛·企微管家企业微信增长咨询专线),获取专</span></p><p style="text-align: center;"><span style="font-size: 11pt;">属方案</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">上周,腾讯两大团队纷纷下场做起了AI模型评测。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">7月24号,WorkBuddy编码助手团队出了一套AI模型评测,跑了7个主流模型。三天后,混元团队又出了一套,跑了11个。两套评测加一起583道题。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">结果呢?没有一个模型能通吃所有场景。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">简单来说:腾讯用自己的产品告诉你,别信什么"最强AI模型"的说法。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">选模型这件事,得看你要干什么活。</span></p><p style="text-align: justify;"><span style="font-size: 13.5pt; color: rgb(41, 114, 244);">01 WorkBuddy是怎么考的?</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">市面上很多AI评测有个通病——题目网上能搜到。模型可能不是真会,是"背题"考的高分。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">WorkBuddy团队不这么干。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">他们从真实的代码提交记录、安全漏洞里挖素材,倒过来改写成日常开发需求。改完之后拿去搜索引擎搜,搜不到原始出处。换句话说,刷题没用,考的是真本事。</span></p><p style="text-align: justify;"><img src="https://wdcdn.qpic.cn/MTMxMDI3MDE0MTQzMTQ4NTg_781358_NRIvnhTdQbh_Kan9_1786418449?imageView2/format/jpg?w=1080&h=654" width="588.733" height="356.511"></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">考试分四条线:</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">写代码:80道题,修bug只占10道,剩下70道是加功能、写测试、搞算法分析。每道题还带角色扮演——开发者、算法工程师、PM、QA轮着来,模拟同事给你发消息的感觉。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">做前端:70道题,每道题必须交付能跑的东西。评测系统真的会去点按钮、检查交互、刷新页面看数据还在不在,不是写段代码就过关。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">处理文件:50道题,模型面对的是表格、PDF、JSON混在一起的工作区。改一个文件,还得检查关联文件有没有跟着出错。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">安全审计:60道题,红蓝对抗。全程用程序判分,不用AI当裁判,防止裁判作弊。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">成绩单:排行榜靠不住了</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">论文公开了</span><span style="font-size: 12pt; color: rgb(51, 51, 51);">7个模型用两套执行环境各跑一遍的成绩,共8张成绩单。看出三件事:</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">第一,没有全能选手。Claude Opus在写代码上最强,GPT-5.5在办公场景一套环境里拿了最高分(86.05%),GLM-5.2在安全赛道两套环境都是第一(80.86%)。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">第二,换个工具链,排名就变。GPT-5.5和GLM-5.2在代码赛道两套环境下排名是反的。同一个模型搭不同工具跑,结果完全不一样。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">第三,开源模型在安全上压着闭源打。GLM-5.2拿了80.86%,Claude Opus只有65.87%。</span></p><p style="text-align: justify;"><span style="font-size: 13.5pt; color: rgb(41, 114, 244);">02 混元又出了一道更狠的</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">WorkBuddy测的是"给你一个工作区,把活干完"。E-Bench测的是"在一个产品环境里,一步步调工具把事办成"。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">他们拿三个腾讯产品模拟了真实场景:王者荣耀(加好友、组队匹配)、QQ音乐(搜歌、管歌单)、腾讯会议(查员工、订会议室、排日程)。三个场景合起来:41张数据表、7.6万行数据、1219个实体,从头搭建的。</span></p><p style="text-align: justify;"><img src="https://wdcdn.qpic.cn/MTMxMDI3MDE0MTQzMTQ4NTg_848254_qjgHr2UsGylj_udQ_1786418449?imageView2/format/jpg?w=1080&h=424" width="588.733" height="231.132"></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">任务怎么出?</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">用一个强模型当"出题人",能查全库、能写代码。先探索数据库,挑真实数据,执行操作,记下结果当标准答案。再找三个不同模型当验证官,至少两个认可才收录。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">关键设计——出题人全知,解题人半盲。</span></p><p style="text-align: justify;"><img src="https://wdcdn.qpic.cn/MTMxMDI3MDE0MTQzMTQ4NTg_690590__S0OJAokr9VvFGiR_1786418449?imageView2/format/jpg?w=1080&h=917" width="588.733" height="499.878"></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">出题人能看到数据库全貌,所以能出"把收藏里所有两年前发行的歌删掉"这种题。解题人看不到,只能通过业务工具一步步查。没循环权限,没SQL权限,硬着头皮一条条调工具。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">11个模型测下来:没那么漂亮</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">最强的Kimi-K3,准确率73.79%。最好的模型,将近四分之一的题做不对。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">更扎心的是:跑三次总有一次能做对,概率87.62%。但连续三次全做对,只有58.82%。目前没有模型超过60%。做对一次可能是运气,连续做对才是真本事。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">王者荣耀最难,平均43.64%;QQ音乐最简单,61.39%。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">还有个发现:给了代码执行能力后,排名大洗牌。Claude Opus从68.78%跳到81.11%,反超Kimi-K3。Gemini涨了47%,从第9冲到第6。会写代码的模型,在这种需要自己解决问题的场景里占大便宜。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">成本也值得看——DeepSeek单任务0.028美元,准确率47.7%;Kimi-K3单任务0.634美元,准确率73.8%。选模型不只看效果,还得算账。</span></p><p style="text-align: justify;"><span style="font-size: 13.5pt; color: rgb(41, 114, 244);">03 企业选AI,思路该变了</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">两篇论文有局限。WorkBuddy代码题以Python为主,其他语言覆盖不够。E-Bench场景是合成的,跟真实产品有差距。但价值不在"完美",在"公开"。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">以前选AI模型,看排行榜、看测评、凭感觉。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">现在腾讯用自己的产品讲了一件事:没有通吃的模型。写代码强的,处理文件可能拉胯。这套工具链跑得稳,换一套可能翻车。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">光看准确率不行,还得算成本、看稳定性。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">Agent时代选模型,跟招人有点像——不是找最牛的,是找最合适的那一个。</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">如果你正在关注AI工具怎么落地到实际工作中</span><span style="font-size: 12pt; color: rgb(51, 51, 51);">,我们整理了多个AI模型和Agent的使用指南,包括WorkBuddy,KiMi K3,从零基础到上手实操都有。</span><span style="font-size: 12pt; color: rgb(51, 51, 51);">还可以免费咨询企业AI落地相关服务~</span></p><p style="text-align: justify;"><span style="font-size: 12pt; color: rgb(51, 51, 51);">扫码</span><span style="font-size: 12pt; color: rgb(51, 51, 51);">,即可获取哦~</span></p><p style="text-align: justify;"><span style="font-size: 11pt;">可以直接联系:手机/微信:18061501128(微盛·企微管家企业微信增长咨询专线),获取专属方案</span></p><p style="text-align: center;"><img src="https://wdcdn.qpic.cn/MTY4ODg1NjY1NTg1NTI5Nw_926931_S4ex4SsPTOBmwLyA_1780391882?w=396&h=396&type=image/png" width="396" height="396"></p><p style="text-align: center;"><span style="font-size: 11pt; color: rgb(51, 51, 51);"> </span></p>
点赞(
55
)
本文分类:
营销裂变
本文标签:
浏览次数:
7051
次浏览
发布日期:2026-08-11 11:20:19
本文链接:
https://college.wshoto.com/a/316927.html
上一篇 >
张一鸣三次否决模型蒸馏,为什么豆包能升至战略C位?
下一篇 >
别再靠感觉做直播了,这份《直播运营思维导图》帮你搭建完整方法论
收藏
分享
别再靠感觉做直播了,这份《直播运营思维导图》帮你搭建完整方法论
腾讯自测?一周两篇论文,揭露AI Agent的真相
张一鸣三次否决模型蒸馏,为什么豆包能升至战略C位?
WorkBuddy使用100课#11|HR必学AI技巧,用WorkBuddy批量筛选简历
评论列表
共有
0
条评论
暂无评论
发表评论
取消回复
登录
注册新账号
微信公众账号
微信扫一扫加关注
发表
评论
返回
顶部
发表评论 取消回复