← 返回数据集列表
体育与娱乐 / 待核查

电影对白语料库(Cornell 原始版)

见 README_中文.md。

数据规模未核实
文件格式TXT 文本
文件大小下载压缩包约 9.6 MB
电影对白语料库(Cornell 原始版)预览

数据交付

本条目提供数据和数据说明,暂未提供可运行教学案例。需要自行完成建模或实验。

数据集介绍

【数据集名称】电影对白语料库(Cornell 原始版) 【门类归属】体育与娱乐 / 影视数据 【数据类型与任务】未识别;待核查 【数据规模】未核实 【文件格式】TXT 文本 【压缩包大小】下载压缩包约 9.6 MB 【数据划分】资料合集类数据,非模型训练用途,无训练集/验证集/测试集划分。 【标签或字段】无标注标签:本数据集是资料/表格数据,不含分类或目标检测标注;完整的字段与类别说明见压缩包内的数据字典文件 data-dictionary.csv。 【类型关键参数】未核实 【目录结构】 cornell-moviedialog-corpus.zip(解压后) .DS_Store README.txt chameleons.pdf movie_characters_metadata.txt movie_conversations.txt …… 根目录共 8 个文件 【怎么使用】 数据就是一张张普通的 CSV 表格文件,用 Excel 或 WPS 双击打开就能直接看;用 Python 处理的话: import pandas as pd df = pd.read_csv("data-dictionary.csv") # 其余 CSV 同理 每张表有多少行、有哪些列,见压缩包内的 file-manifest.csv 和 data-dictionary.csv。 【数据体检结果】 · 数据体检未发现问题,可放心使用。

整理与使用信息

原作者rajathmc

本站处理内容

本站已完成的工作: 1. 中文名称与用途说明整理(对照原站信息逐项核对); 2. 全量文件清点与 SHA256 校验(file-manifest.csv,可溯源); 3. 自动质检报告(quality-report.json:结构、编码、重复、标注一致性等); 4. 数据字典整理(data-dictionary.csv,字段/类别中英对照); 5. 预览样例抽取(preview/,供购买前判断内容)。

中文整理说明

门类:体育与娱乐 / 影视数据(依据《数据集中文分类体系》) 中文命名:电影对白语料库(Cornell 原始版)(原始名称 rajathmc/cornell-moviedialog-corpus) 已知问题:自动检查未发现问题(详见 quality-report.json) 配套文档:简明说明.md、README_中文.md、数据字典、文件清单、质检报告、预览样例(均随网盘下载包提供)。