我评价为:B站总算开窍了哈哈哈哈哈
随着大模型能力提升,作为 AI 自媒体,现在很头疼如何评测模型。 为了能让普通人看懂,大家只能选鹈鹕骑自行车、Threejs 3D游戏、Fancy的前端效果、各种精美PPT来告诉大家:这个模型不错。 另一方面,看起来专业的大模型 Benchmark 也开始失效,各种刷榜、刷Openrouter用量。 加上题目污染和大模...
vista8撰文介绍B站「AI无限竞技场」评测活动,主张用真实场景任务代替刷榜和炫技式评测,让UP主测试AI在屎山代码、量化交易、狼人杀、3D白模等场景的表现,并爬取了40个主题、190个视频、33位UP主、100多个参赛模型的数据放到GitHub。榜单前三为GPT6-Astra、Fable 5.1、GLM-5.3;karminski转发评价B站总算开窍了。
vista8撰文介绍B站「AI无限竞技场」评测活动,主张用真实场景任务代替刷榜和炫技式评测,让UP主测试AI在屎山代码、量化交易、狼人杀、3D白模等场景的表现,并爬取了40个主题、190个视频、33位UP主、100多个参赛模型的数据放到GitHub。榜单前三为GPT6-Astra、Fable 5.1、GLM-5.3;karminski转发评价B站总算开窍了。
我评价为:B站总算开窍了哈哈哈哈哈
来源:karminski-牙医· x.com