无码av一区二区三区无码,在线观看老湿视频福利,日韩经典三级片,成 人色 网 站 欧美大片在线观看

歡迎光臨散文網(wǎng) 會(huì)員登陸 & 注冊(cè)

ChatGLM2-12B 效果怎么樣?官方公布

2023-07-28 00:03 作者:ChatGLM  | 我要投稿

ChatGLM2 系列模型發(fā)布月余,大家對(duì) ChatGLM2-6B 的效果已經(jīng)有較多認(rèn)知。我們現(xiàn)在公布 ChatGLM2-12B 在部分中英文典型數(shù)據(jù)集上的評(píng)測(cè)效果,供大家參考。這些數(shù)據(jù)集包括 MMLU(英文)、C-Eval(中文)、GSM8K(數(shù)學(xué)) 和 BBH(英文) 等。

ChatGLM2-12B 模型在這些數(shù)據(jù)集上取得了不錯(cuò)的成績(jī)。我們將繼續(xù)不斷改進(jìn)和優(yōu)化模型,以提供更優(yōu)質(zhì)的模型效果。

具體信息請(qǐng)參考:https://github.com/THUDM/ChatGLM2-6B


MMLU

Chat 模型使用 zero-shot CoT (Chain-of-Thought) 的方法測(cè)試,Base 模型使用 few-shot answer-only 的方法測(cè)試。

C-Eval

Chat 模型使用 zero-shot CoT 的方法測(cè)試,Base 模型使用 few-shot answer only 的方法測(cè)試。

GSM8K

所有模型均使用 few-shot CoT 的方法測(cè)試,CoT prompt 來(lái)自??http://arxiv.org/abs/2201.11903

* 我們使用翻譯 API 翻譯了 GSM8K 中的 500 道題目和 CoT prompt 并進(jìn)行了人工校對(duì)。

BBH

所有模型均使用 few-shot CoT 的方法測(cè)試,CoT prompt 來(lái)自?

https://github.com/suzgunmirac/BIG-Bench-Hard/tree/main/cot-prompts

ChatGLM2-12B 效果怎么樣?官方公布的評(píng)論 (共 條)

分享到微博請(qǐng)遵守國(guó)家法律
东山县| 前郭尔| 峨山| 大同县| 滦平县| 循化| 鲁甸县| 噶尔县| 远安县| 磐安县| 额尔古纳市| 勃利县| 长丰县| 黔西| 石棉县| 新干县| 延庆县| 资源县| 巴彦县| 西昌市| 昌图县| 甘洛县| 永登县| 霍山县| 小金县| 广平县| 保康县| 波密县| 调兵山市| 九寨沟县| 敖汉旗| 城口县| 怀安县| 安义县| 渝中区| 宾川县| 高邑县| 铁岭市| 台东市| 静海县| 四子王旗|