6 月 8 日消息,国产国产多模态大语言模型 TigerBot 近日正式发布,发布包含 70 亿参数和 1800 亿参数两个版本,效果目前已经在 GitHub 开源。可达开源
▲ 图源 TigerBot 的模型模型 GitHub 页面
据悉,TigerBot 带来的国产创新主要在于:
此外,可达开源该模型还针对中文语言更不规则的模型模型分布,从 tokenizer 到训练算法上做了更适合的国产优化。
研究人员陈烨在虎博科技官网表示:“该模型在只使用少量参数的发布情况下,就能快速理解人类提出了哪类问题。根据 OpenAI InstructGPT 论文在公开 NLP 数据集上的自动评测,TigerBot-7B 已达到 OpenAI 同样大小模型的综合表现的 96%。”
▲ 图源 TigerBot 的 GitHub 页面
据称,其中 TigerBot-7B-base 的表现“优于 OpenAI 同等可比模型” ,开源代码包括基本训练和推理代码,双卡推理 180B 模型的量化和推理代码。数据包括 100G 预训练数据,监督微调 1G 或 100 万条数据。
IT之家小伙伴们可以在这里找到 GitHub 的开源项目。
责任编辑:姜华 来源: IT之家 OpenAITigerBot(责任编辑:时尚)
航天科技集团研制大气环境监测卫星大气一号上线 高精度监测能力提升
《邮件时间》4/27登陆PC PS5/PS4/NS版夏季推出
国家统计局:10月份货物进出口总额33357亿元 出口19408亿元