AI奇点网5月31日报道丨熟悉大模型的朋友都曾经听过这么一个网站——LMSYS Org推出的大模型竞技场Chatbot Arena,该网站目前已发展为海外最具公信力的大模型榜单之一,但遗憾的是,该竞赛榜单的中文水平含金量程度相对不足。
近日,上海人工智能实验室联合阿里魔搭社区(ModelScope)推出中国大语言模型评测竞技场Compass Arena,首度集齐国内开源大模型届豪强。
Compass Arena首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、讯飞星火、字节跳动豆包、智谱AI、百川智能、零一万物、月之暗面、Minimax、深度求索、书生·浦语等等,共计20多款国产大模型出战,角逐中国大模型“最强王者”。
据介绍,相比考题固定的传统测评,由上海人工智能实验室打造的Compass Arena大模型竞技场采用盲测、开放的测评模式,可以更全面地检验模型实力。
Compass Arena设置了随机、匿名对战,大模型选手们成为“蒙面唱将”,模型信息隐去后,由系统随机匹配进行PK,用户可以天马行空自由出题,并作为评委主观评判和投票。如果大模型不小心“自报家门”,则对话被过滤,不计入成绩。通过成千上万轮PK挑战和用户投票,系统将对大模型进行自动排名。
AI奇点网了解到,Compass Arena由上海人工智能实验室OpenCompass司南评测体系与魔搭社区联合建设,前者负责组织评测,后者负责开源模型引入及社区打造。据上海人工智能实验室OpenCompass团队介绍,Compass Arena力求体现社区用户的真实反馈,评测机制借鉴Chatbot Arena,采用Elo评分系统,即国际象棋等对弈活动评估的权威标准。
在这种模式下,大模型竞技类似“在游戏中打排位”,胜率成为评估模型水平的关键指标,同时随着排位变高,系统也会自动匹配高段位选手进行对战。
与海外的Chatbot Arena大模型竞技场相比,国产的Compass Arena更聚焦中文大模型,主流国产大模型全覆盖,同时评测用户大多使用中文,可以充分评估国产大模型的性能。
目前,Compass Arena已汇聚国内超过20款的商业及社区开源大模型,其中不乏来自BAT的大厂模型。包括Qwen-Max、ERNIE-4.0-8K、Spark3.5 Max、Abab6.5、GLM4等国内头部人工智能开发商的旗舰款大模型,并引入了海外的Llama3、Mixtral AI等海外标杆模型进行参照。
未来,更多模型及厂商还在不断加入中。
入选Compass Arena大模型竞技场的首批国产大模型名单如下:
上一篇:首次解密Claude 3大脑!25岁Anthropic参谋长预言3年内自己将被AI淘汰
下一篇:苹果OpenAI曝出「数十亿美元」合作,微软急了!纳德拉紧急约谈奥特曼
聚焦智能天文光学系统,打造人类“天眼”。
一家机器人公司如何穿越行业“死亡谷”?
教师职业三重变革:从编制铁饭碗到流量新战场,谁在定义未来教育者?
苹果发布超薄iPhoneAir,评价两极,或为折叠屏预热。
你是不是也经常遇到“AI配音”的视频?
苹果还没有熟透。
豆包
博思白板 — boardmix AI
扣子-AI办公
千问
讯飞绘文
讯飞绘文-免费AI写作
扣子-AI办公app
AI小聚
ZeroGPT
网站地图
首个「中文大模型竞技场」Compass Arena上线,叫得上名字的国产大模型全员大PK
AI奇点网5月31日报道丨熟悉大模型的朋友都曾经听过这么一个网站——LMSYS Org推出的大模型竞技场Chatbot Arena,该网站目前已发展为海外最具公信力的大模型榜单之一,但遗憾的是,该竞赛榜单的中文水平含金量程度相对不足。
近日,上海人工智能实验室联合阿里魔搭社区(ModelScope)推出中国大语言模型评测竞技场Compass Arena,首度集齐国内开源大模型届豪强。
Compass Arena首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、讯飞星火、字节跳动豆包、智谱AI、百川智能、零一万物、月之暗面、Minimax、深度求索、书生·浦语等等,共计20多款国产大模型出战,角逐中国大模型“最强王者”。
据介绍,相比考题固定的传统测评,由上海人工智能实验室打造的Compass Arena大模型竞技场采用盲测、开放的测评模式,可以更全面地检验模型实力。
Compass Arena设置了随机、匿名对战,大模型选手们成为“蒙面唱将”,模型信息隐去后,由系统随机匹配进行PK,用户可以天马行空自由出题,并作为评委主观评判和投票。如果大模型不小心“自报家门”,则对话被过滤,不计入成绩。通过成千上万轮PK挑战和用户投票,系统将对大模型进行自动排名。
AI奇点网了解到,Compass Arena由上海人工智能实验室OpenCompass司南评测体系与魔搭社区联合建设,前者负责组织评测,后者负责开源模型引入及社区打造。据上海人工智能实验室OpenCompass团队介绍,Compass Arena力求体现社区用户的真实反馈,评测机制借鉴Chatbot Arena,采用Elo评分系统,即国际象棋等对弈活动评估的权威标准。
在这种模式下,大模型竞技类似“在游戏中打排位”,胜率成为评估模型水平的关键指标,同时随着排位变高,系统也会自动匹配高段位选手进行对战。
与海外的Chatbot Arena大模型竞技场相比,国产的Compass Arena更聚焦中文大模型,主流国产大模型全覆盖,同时评测用户大多使用中文,可以充分评估国产大模型的性能。
目前,Compass Arena已汇聚国内超过20款的商业及社区开源大模型,其中不乏来自BAT的大厂模型。包括Qwen-Max、ERNIE-4.0-8K、Spark3.5 Max、Abab6.5、GLM4等国内头部人工智能开发商的旗舰款大模型,并引入了海外的Llama3、Mixtral AI等海外标杆模型进行参照。
未来,更多模型及厂商还在不断加入中。
入选Compass Arena大模型竞技场的首批国产大模型名单如下:
Abab6.5-Chat (MiniMax)Baichuan 4 (百川智能)C4AI Command R+ (Cohere)DBRX-Instruct (DataBricks)Deepseek-LLM-67B-Chat(深度求索)Deepseek-MoE-16B-Chat(深度求索)Doubao-Pro-4K (字节豆包)ERNIE-4.0-8K (百度文心)GLM4 (智谱AI)Hunyuan-Pro (腾讯混元)InternLM2系列(上海AILab书生·浦语)Llama3系列(Meta)Mixtral 8x22B Instruct (Mistral)MoonShot-V1-32K (月之暗面)Qwen1.5系列 (阿里通义千问)Qwen-Max (阿里通义千问)Spark3.5-Max (讯飞星火)Yi-34B-Chat (零一万物)Yi-Large (零一万物)上一篇:首次解密Claude 3大脑!25岁Anthropic参谋长预言3年内自己将被AI淘汰
下一篇:苹果OpenAI曝出「数十亿美元」合作,微软急了!纳德拉紧急约谈奥特曼
追觅「上天」,官宣成立天文BU|最前线
聚焦智能天文光学系统,打造人类“天眼”。
三临绝境,三度翻盘:一家机器人公司的15年“极限求生”
一家机器人公司如何穿越行业“死亡谷”?
招生锐减、硕博下沉、AI创业——教师职业的破与立
教师职业三重变革:从编制铁饭碗到流量新战场,谁在定义未来教育者?
OpenAI CEO奥特曼点赞iPhone Air,分析师直呼:它只是苹果的试验品
苹果发布超薄iPhoneAir,评价两极,或为折叠屏预热。
偷走全红婵声音,在网上卖鸡蛋?你看的明星带货直播,可能是AI偷来的……
你是不是也经常遇到“AI配音”的视频?
库克不再「挤牙膏」:iPhone薄了,AI缺席
苹果还没有熟透。
豆包
博思白板 — boardmix AI
扣子-AI办公
千问
讯飞绘文
讯飞绘文-免费AI写作
扣子-AI办公app
豆包
博思白板 — boardmix AI
扣子-AI办公
千问
讯飞绘文
讯飞绘文-免费AI写作
扣子-AI办公app
AI小聚
ZeroGPT