当前位置: 首页 > news >正文

网站建设廉政风险点意大利设计网站

网站建设廉政风险点,意大利设计网站,怎样提高网站浏览量,东莞市做阀门的网站基于论文摘要的文本分类与关键词抽取挑战赛​​​​​​2023 iFLYTEK A.I.开发者大赛-讯飞开放平台 环境需求:Anaconda-JupyterNotebook,或者百度AIStudio 赛题解析: 【文本二分类任务】根据论文摘要等信息理解,将论文划分为0-1两…

基于论文摘要的文本分类与关键词抽取挑战赛
​​​​​​2023 iFLYTEK A.I.开发者大赛-讯飞开放平台

环境需求:Anaconda-JupyterNotebook,或者百度AIStudio

赛题解析:

【文本二分类任务】根据论文摘要等信息理解,将论文划分为0-1两类别之一。
【文本关键词识别任务】从给定的论文中识别和提取出与论文内容相关的关键词。

数据样例:title、author、Abstract、Keywords、[label] 0-1

一键运行的时候先把csv删了(是运行结果)

安装nltk【更换镜像源避免安装出错】

!pip install nltk -i http://mirrors.aliyun.com/pypi/simple/  --trusted-host mirrors.aliyun.com
# 导入pandas用于读取表格数据
import pandas as pd# 导入BOW(词袋模型)
from sklearn.feature_extraction.text import CountVectorizer
#可以替换为TfidfVectorizer(TF-IDF(词频-逆文档频率))
#注意上下文要同时修改,亲测后者效果更佳# 导入LogisticRegression回归模型
from sklearn.linear_model import LogisticRegression# 过滤警告消息
from warnings import simplefilter
from sklearn.exceptions import ConvergenceWarning
simplefilter("ignore", category=ConvergenceWarning)# 读取数据集
train = pd.read_csv('/home/aistudio/data/data231041/train.csv')
train['title'] = train['title'].fillna('')
train['abstract'] = train['abstract'].fillna('')test = pd.read_csv('/home/aistudio/data/data231041/testB.csv')
test['title'] = test['title'].fillna('')
test['abstract'] = test['abstract'].fillna('')# 提取文本特征,生成训练集与测试集
train['text'] = train['title'].fillna('') + ' ' +  train['author'].fillna('') + ' ' + train['abstract'].fillna('')+ ' ' + train['Keywords'].fillna('')
test['text'] = test['title'].fillna('') + ' ' +  test['author'].fillna('') + ' ' + test['abstract'].fillna('')vector = CountVectorizer().fit(train['text'])
train_vector = vector.transform(train['text'])
test_vector = vector.transform(test['text'])# 引入模型
model = LogisticRegression()# 开始训练,这里可以考虑修改默认的batch_size与epoch来取得更好的效果
model.fit(train_vector, train['label'])# 利用模型对测试集label标签进行预测
test['label'] = model.predict(test_vector)
test['Keywords'] = test['title'].fillna('')
test[['uuid','Keywords','label']].to_csv('submit_task1.csv', index=None)

ndarray.finall()方法:填充空值

pandas数据处理常用命令_ndarray fillna_hellosc01的博客-CSDN博客

Basedline的方法:BOW词袋提取特征-LR逻辑回归-进行预测

改进方法:TF-IDF,SVM,epoches

# TfidfVectorizer(TF-IDF(词频-逆文档频率))
from sklearn.feature_extraction.text import TfidfVectorizer
# 导入支持向量机分类器
from sklearn.svm import SVC#创建SVM训练模型 
model = SVC(kernel='linear', C=1)# 利用模型对测试集label标签进行预测
test['label'] = model.predict(test_vector)
test['Keywords'] = test['title'].fillna('')
test[['uuid','Keywords','label']].to_csv('submit_task2.csv', index=None)

by ライト

http://www.yayakq.cn/news/753792/

相关文章:

  • 做网站的必备软件爱站网seo综合查询工具
  • 营销型企业网站模板搜索引擎是网站吗
  • 青县建设银行网站做网站都需要学什么
  • 幼儿教育网站源码网站关键词怎么改
  • 汕头网站设计公司网站cn和com有什么区别
  • 凡科建站官网江苏国税网站电子申报怎么做
  • 佛山seo网站推广批量 网站标题
  • 贾汪区住房和城乡建设局网站保健品网站源码
  • 佛山网站建设网站建设有了实名制域名怎么做网站
  • 黑龙江建设人员证件查询网站微信开放平台登陆
  • 临西网站建设费用有口碑的南昌网站制作
  • 网站html地图导航代码微信公众平台注册方法
  • 生物公司网站建设方案网站页面做专题的步骤
  • 邢台网站制作市场网站建设维护内容
  • 东莞设计制作网站制作邯郸网络运营中心电话多少
  • 网站建设到发布2012sevser网页投票链接怎么做
  • 新建网站求友链平台上海浦东刚刚发生的命案
  • 网站开发网页排名软件
  • 建设银行官方网站买五粮液酒男女做爰网站
  • 做网站公司经营范围企业网站建设案例分析
  • 机关 网站 建设方案wordpress 内容页
  • 浙江网站建设上市公司网站开发团队哪些人
  • 建设银行网站会员笔记转wordpress
  • wordpress域名替换seo是什么的简称
  • 上海建站网站建设网页设计html基础代码
  • 目前做定制产品的网站厦门的一个做设计的网站
  • 免费个人网站建设制作代码北京朝阳区二手房出售
  • 互联网站建设用法青岛企业名录大全
  • 计算网站制作教程wordpress多本小说
  • 创意产品网站seo服务理念