当前位置: 首页 > news >正文

建设 网站工作汇报vx网页版

建设 网站工作汇报,vx网页版,wordpress网站如何添加栏目,wordpress怎么用百度主动推送浅谈人工智能之Llama3微调后使用cmmlu评估 引言 随着自然语言处理(NLP)技术的发展,各类语言模型如雨后春笋般涌现。其中,Llama3作为一个创新的深度学习模型,已经在多个NLP任务中展示了其强大的能力。然而&#xff0c…

浅谈人工智能之Llama3微调后使用cmmlu评估

引言

随着自然语言处理(NLP)技术的发展,各类语言模型如雨后春笋般涌现。其中,Llama3作为一个创新的深度学习模型,已经在多个NLP任务中展示了其强大的能力。然而,仅仅使用预训练模型往往无法满足特定应用的需求,因此微调成为了提升模型表现的重要步骤。本文将集中讨论Llama3模型在微调后的推理和评估过程
在之前文章中我们已经介绍了如何使用LLaMA-Factory工具进行模型微调和推理,本文介绍如何在微调以后对模型进行评估

评估阶段

模型的评估是验证微调效果的重要步骤。评估通常采用以下方法:

  1. 性能指标:根据任务类型,选择适合的评估指标。例如,对于分类任务,可以使用准确率、精确率、召回率和F1-score;而对于生成任务,则可以使用BLEU、ROUGE等指标。
  2. 验证集与测试集:在微调过程中,通常会划分出验证集来监控模型的表现,最终评估则应在未见过的测试集上进行,以评估模型的泛化能力。
  3. 错误分析:在评估过程中,分析模型的错误输出,以识别潜在的问题和改进方向。
  4. 用户反馈:在实际应用中,从用户那里获取反馈,进一步评估模型的实用性和准确性。
    当前我们可以使用cmmlu进行微调后的模型评估。

CMMLU介绍

CMMLU是针对中国的语言和文化背景设计的评测集,用来评估LLM的知识蕴含和推理能力。该评测集跨多个学科,由67个主题组成。其中大多数任务的答案都是专门针对中国的文化背景设计,不适用于其它国家的语言。如下图所示,除了涵盖人文科学、社会科学、STEM(科学、技术、工程和数学)以及其他在人类日常生活中很重要的四个通用领域的知识外,还涵盖一些特定领域的知识,用于验证模型的中国知识的蕴含能力以及对中文的理解和适应能力。

模型评估

第一步:进入llama_factory虚拟环境,若已经进入请忽略

conda activate llama_factory

第二步:然后进入/mnt/workspace/LLaMA-Factory/examples/train_lora路径

cd /mnt/workspace/LLaMA-Factory/examples/train_lora

第三步:我们可以看到在该目录下有文件llama3_lora_eval.yaml,我们打开文件内容,并且把文件内容修改成如下内容

### model
model_name_or_path: /mnt/workspace/models/Meta-Llama-3-8B-Instruct
adapter_name_or_path: /mnt/workspace/models/llama3-lora-zh### method
finetuning_type: lora### dataset
task: cmmlu_test  # choices: [mmlu_test, ceval_validation, cmmlu_test]
template: fewshot
lang: en
n_shot: 5### output
save_dir: saves/llama3-8b/lora/eval_cmmlu### eval
batch_size: 1

第四步:我们回到/mnt/workspace/LLaMA-Factory路径

cd /mnt/workspace/LLaMA-Factory

第五步:我们执行如下命令

llamafactory-cli eval examples/train_lora/llama3_lora_eval.yaml

第六步:我们可以看到模型微调后的模型已经开始评估

Generating test split: 179 examples [00:00, 13736.47 examples/s] | 12/67 [04:35<26:02, 28.41s/it, 中国文学]
Generating train split: 5 examples [00:00, 1315.82 examples/s]
Generating test split: 106 examples [00:00, 11332.20 examples/s] | 13/67 [05:01<24:56, 27.71s/it, 中国教师资格]
Generating train split: 5 examples [00:00, 825.29 examples/s]
Generating test split: 107 examples [00:00, 11506.56 examples/s] | 14/67 [05:19<21:59, 24.90s/it, 大学精算学]
Generating train split: 5 examples [00:00, 1331.61 examples/s]
Generating test split: 106 examples [00:00, 11195.51 examples/s] | 15/67 [05:33<18:31, 21.38s/it, 大学教育学]
Generating train split: 5 examples [00:00, 1258.64 examples/s]
Generating test split: 108 examples [00:00, 11522.52 examples/s] | 16/67 [05:46<16:02, 18.87s/it, 大学工程水文学]
Generating train split: 5 examples [00:00, 1374.28 examples/s]
Generating test split: 105 examples [00:00, 10783.59 examples/s] | 17/67 [06:02<15:01, 18.03s/it, 大学法律]
Generating train split: 5 examples [00:00, 959.49 examples/s]
Generating test split: 106 examples [00:00, 11444.80 examples/s] | 18/67 [06:20<14:40, 17.98s/it, 大学数学]
Generating train split: 5 examples [00:00, 1384.17 examples/s]
Generating test split: 237 examples [00:00, 14848.76 examples/s] | 19/67 [06:34<13:25, 16.78s/it, 大学医学统计]

第七步:评估的时间会比较久,这里笔者用了差不多半个小时,评估分数结果如下

        Average: 47.70                                      STEM: 41.05
Social Sciences: 49.23Humanities: 47.61Other: 51.65

至此分数评估结束。

http://www.yayakq.cn/news/727662/

相关文章:

  • 手机网店开店网站西安网站托管公司招聘
  • 医院网站建设策划书分级会员管理系统网站开发
  • 通辽做网站0475seo个人网站模板怎么做
  • 深圳优秀网站设计宁波网站设计方案
  • 怎么把自己的网站上传到百度wordpress添加+下载
  • 网站建设的安全措施企业标准化体系建设流程
  • 手机网站html模板注册商标查询网
  • 外贸网站建设盲区wordpress压缩图片
  • .net做网站c#企业做网站设计
  • 手机网站用什么后台网页模板下载后怎么用
  • 企业网站运营怎么做租房网站
  • 重庆市建设安全监督站的网站用户注册页面html代码
  • python建设网站网站运营企业
  • ps拼合网站截图怎么做中国医生电影网络营销推广方法
  • 完美建设工程有限公司网站域名怎么起
  • 美食怎么做的小视频网站昆山做网站怎么做
  • 从零开始自己做外贸网站和海外网络营销个人养老保险2023价格表
  • 试述建设一个网站的具体步骤百度学术官网入口网页版
  • 淘宝网的网站设计特色怎么做淘宝客优惠劵网站
  • 站点推广是什么意思兰州专业网站建设报价
  • 做网站内容字体多少pt免备案空间推荐
  • 策划与设计一个电子商务网站柳州市建设中心网站首页
  • 网站权重7怎么做程序员做网站赚钱
  • 横沥东莞网站建设洛阳网站排名
  • 泰安网站建设 九微米wordpress本地utc
  • 做打鱼网站网站添加字体
  • 贵州建设职业学院官方网站外贸网站设计公司价格
  • tomcat做网站wordpress 取消自适应
  • 做研学的企业网站科技资讯网站有哪些
  • 网站制作潍坊区域建微信网站