电影对白数据集(Cornell 语料)
见 README_中文.md。

数据交付
本条目提供数据和数据说明,暂未提供可运行教学案例。需要自行完成建模或实验。
数据集介绍
【数据集名称】电影对白数据集(Cornell 语料) 【门类归属】体育与娱乐 / 影视数据 【数据类型与任务】未识别;待核查 【数据规模】304713 条记录(Parquet 单表) 【文件格式】Parquet 数据表 【压缩包大小】数据文件约 12.5 MB(Parquet,无压缩包) 【数据划分】数据是一个整体文件(1 个数据文件装下全部 1 条记录),下载后即可直接使用,无需再划分。 【标签或字段】无标注标签:本数据集是资料/表格数据,不含分类或目标检测标注;完整的字段与类别说明见压缩包内的数据字典文件 data-dictionary.csv。 【类型关键参数】304713 行 × 1 列;字段:text 【目录结构】 数据文件 data/train-00000-of-00001-a19c10f9666706bb.parquet └── 单个 Parquet 数据文件(含全部记录) 【怎么使用】 整个数据集是一张数据表:一列是图片本身,另一列是类别编号。用 Python 的 pandas 一行代码就能打开: import pandas as pd df = pd.read_parquet("data\train-00000-of-00001-a19c10f9666706bb.parquet") # 304713 行 字段的中文说明见压缩包内的 data-dictionary.csv。 【数据体检结果】 · 数据体检未发现问题,可放心使用。
整理与使用信息
本站处理内容
本站已完成的工作: 1. 中文名称与用途说明整理(对照原站信息逐项核对); 2. 全量文件清点与 SHA256 校验(file-manifest.csv,可溯源); 3. 自动质检报告(quality-report.json:结构、编码、重复、标注一致性等); 4. 数据字典整理(data-dictionary.csv,字段/类别中英对照); 5. 预览样例抽取(preview/,供购买前判断内容)。
中文整理说明
门类:体育与娱乐 / 影视数据(依据《数据集中文分类体系》) 中文命名:电影对白数据集(Cornell 语料)(原始名称 mylesmharrison/cornell-movie-dialog) 已知问题:自动检查未发现问题(详见 quality-report.json) 配套文档:简明说明.md、README_中文.md、数据字典、文件清单、质检报告、预览样例(均随网盘下载包提供)。