做网站办什么类型营业执照网站做装修
3月25日,2024年中国发展高层论坛年会上,国家数据局局长刘烈宏在“释放数据要素价值,助力可持续发展”的演讲中表示,中国10亿参数规模以上的大模型数量已超100个。
当前,国内AI大模型发展仍面临诸多困境。其中,较为突出的就是高质量数据集的匮乏,这极大阻碍了大模型效果提升。特别是专业的行业应用数据集,其获取难度更大,这导致大模型可使用的数据量受到限制,进而对大模型效果形成阻碍。
景联文科技是大语言模型数据供应商,致力于为不同阶段的模型算法匹配高质量数据资源。

世界知识类书籍、期刊、论文及高价值社区文本数据:
- 中文书籍 250万本
 - 高质量外文文献期刊 8500万篇
 - 英文高质量电子书 200万本
 
教育题库:
- 千12教育题库 1800万
 - 大学题库 1.1亿,800万带解析
 - 英文题库 500万
 
专业知识类期刊、专利、代码:
- 中文数字专利 4000万
 - 程序代码(代码注释) 20万
 
多轮对话:
- 文本多轮对话 1500万
 - 中英文剧本(电影、电视剧、剧本杀) 6万
 
音频数据:
- 普通话 65万小时
 
图片生成及隐式/显示推理多模态数据:
- 图文复杂描述 600万
 - 图文推理问答对 600万
 
生物数据:
- 核酸库 4000万
 - 蛋白库 50万
 - 蛋白结构库 19万
 - 通路库 1000万
 - 生信工具
 
药学数据:
- 药物研发数据库 1300万
 - 全球上市数据库 80万
 - 一致性评价数据库 25万
 - 生产检验数据库 40万
 - 合理用药 300万
 - 多维文献 1亿
 - 原料药数据库 1100万
 
化学数据:
- 化合物数据库 1.6亿
 - 反应信息数据库 4100万
 - 物化性质数据库 1.6亿
 - 谱图数据库 20万
 - 晶体信息数据库 100万
 - 安全信息数据库 180万
 - 商品信息数据库 740万
 
材料数据:
- 金属材料数据 20万
 - 纳米材料数据 30万
 - 相图数据 6万
 - 材料性能数据 20万
 - 材料腐蚀数据
 - 表面处理数据
 - 焊接材料数据
 
专利数据:
- 全球专利基础著录数据 1.3亿
 - 全球专利原文数据 1亿
 - 全球专利附图数据
 - 全球专利法律状态数据
 - 全球专利法律状态数据
 - 全球专利引文数据
 - 全球专利分类索引数据
 - 全球专利重点申请人工商关联数据
 - 全球生化医药专利深加工数据
 - 全球专利全文数据
 
医疗器械数据:
- 国内政策法规数据 3千
 - 行业标准数据
 - 中国医疗器械审评数据 20万
 - 中国医械临床试验数据 5千
 - 全球医械临床试验数据 7万
 - 医用耗材中标数据 1400万
 - 医用耗材带量采购数据 400万
 - 医用设备招投标数据38万
 
同时景联文科技提供大模型训练数据的标注服务,致力于为全球数千家人工智能从业公司和高校科研机构交付海量、高质量的多模态大模型训练数据。
景联文科技|数据采集|数据标注|大语言模型训练数据
助力人工智能技术,赋能传统产业智能转型升级
文章图文著作权归景联文科技所有,商业转载请联系景联文科技获得授权,非商业转载请注明出处。
