兼顾理解和生成的中文预训练模型系列
- 2019 | Unified Language Model Pre-training for Natural Language Understanding and Generation | Li Dong, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| Unilm | base | 百度网盘-tblr | 百度网盘-etwf | YunwenTechnology | github | 通用 |
- 2020 | 鱼与熊掌兼得:融合检索和生成的SimBERT模型 | 苏剑林. | spaces |
Blog post
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| SimBERT Tiny | tiny | 百度网盘-1tp7 | ZhuiyiTechnology | github | 通用 | |
| SimBERT Small | small | 百度网盘-nu67 | ZhuiyiTechnology | github | 通用 | |
| SimBERT Base | base | 百度网盘-6xhq | ZhuiyiTechnology | github | 通用 |
- 2021 | SimBERTv2来了!融合检索和生成的RoFormer-Sim模型 | 苏剑林. | spaces |
Blog post
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| roformer-sim | base(L12) | 百度网盘-2cgz | ZhuiyiTechnology | github | 通用 | |
| roformer-sim | small(L6) | 百度网盘-h68q | ZhuiyiTechnology | github | 通用 | |
| roformer-sim-v2 | base(L12) | 百度网盘-w15n | ZhuiyiTechnology | github | 通用 |
| 模型 | 版本 | 类型 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|---|
| Zhouwenwang | base(L12) | roformer | [🤗HF] | IDEA-CCNL | github | 中文通用 | |
| Zhouwenwang | large(L24) | roformer | [🤗HF] | IDEA-CCNL | github | 中文通用 |
- 2021 | CPM-2: Large-scale Cost-effective Pre-trained Language Models | Zhengyan Zhang, et al. | arXiv |
PDF
| 模型 | 版本 | 介绍 | 模型下载 | 作者 | 源地址 | 应用领域 | 备注 |
|---|---|---|---|---|---|---|---|
| CPM-2 | 110亿参数 | 项目首页 | 模型下载 | BAAI-WuDao | github | 通用 | 需要申请才能下载 |
| CPM-2 | 100亿参数 | 项目首页 | 模型下载 | BAAI-WuDao | github | 中英 | 需要申请才能下载 |
| CPM-2 | 1980亿参数 | 项目首页 | 模型下载 | BAAI-WuDao | github | 中英 | 需要申请才能下载 |
- 2021 | CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation | Yunfan Shao, et al. | arxiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| CPT-base | base(L12) | [🤗HF] | fastNLP | github | 通用 | |
| CPT-large | large(L24) | [🤗HF] | fastNLP | github | 通用 |
- 2022 | GLM: General Language Model Pretraining with Autoregressive Blank Infilling | Zhengxiao Du, et al. | arXiv |
PDF - 2022 | GLM-130B: An Open Bilingual Pre-trained Model | Aohan Zeng, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| GLM | large | [🤗HF] | THUDM | github | 通用 | |
| GLM | xxlarge | [🤗HF] | THUDM | github | 通用 | |
| GLM-130B | 130B | 申请地址1申请地址2 | THUDM | github | 通用 |
- 2019 | StructBERT: Incorporating Language Structures into Pre-training for Deep Language Understanding | Wei Wang, et al. | arXiv |
PDF - 2020 | PALM: Pre-training an Autoencoding&Autoregressive Language Model for Context-conditioned Generation | Bin Bi, et al. | ACL|
PDF
| 模型 | 版本 | 模型下载 | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|
| PLUG | 27B | AliceMind-需要申请 | Alibaba | github | 通用 |
- 2022 | 待定 | , et al. | arXiv |
PDF
| 模型 | 版本 | 介绍 | 模型下载 | 作者 | 源地址 | 应用领域 | 备注 |
|---|---|---|---|---|---|---|---|
| OPD | 6.3B | 项目首页 | 模型下载 | thu-coai | github | 中文开放域对话 | 需要申请才能下载 |