ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

FMA 音乐数据集:4 个版本,10 万首曲目怎么选

FMA 音乐数据集:4 个版本,10 万首曲目怎么选 FMA 音乐数据集4 个版本10 万首曲目怎么选【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma想训练音乐分类或推荐模型最先头疼的是数据找音源、理版权、对齐特征一套数据集攒下来能磨掉大半个月。FMA 音乐数据集就是为 MIR音乐信息检索准备的现成方案106,574 首曲目、917GB 音频、161 个流派音频全部走 Creative Commons 授权拿来即用。先选版本FMA 四个数据规模对比先定的不是模型是版本。FMA 按体量分了四档版本大小曲目数流派数适合谁小型7.2GB8,00030 秒片段8平衡验证想法、快速原型中型22GB25,00030 秒片段16不平衡中等规模实验大型93GB106,57430 秒片段161不平衡深入研究完整879GB106,574完整长度—专业研究30 秒片段与完整长度两种格式覆盖了绝大多数需求。没跑过这套数据的话先用 7.2GB 的小型版把流程走通跑顺了再谈扩容。三步跑通 FMA 音乐数据集从拉代码到读进数据一共三步一个下午能结束。第一步拉代码并装依赖git clone https://gitcode.com/gh_mirrors/fm/fma cd fma pip install -r requirements.txt第二步下载对应版本按选好的档位拿配套音频包下完解包879GB 那一档动手前先确认磁盘有 1TB 左右空余。第三步加载数据。项目自带的 utils 模块几行就能把主表读出来import utils tracks utils.load(data/fma_metadata/tracks.csv) genres utils.load(data/fma_metadata/genres.csv) features utils.load(data/fma_metadata/features.csv)数据里到底有什么元数据、层级、特征、专业特征四个 CSV 分工明确文件内容用途tracks.csv每首曲目的元数据ID、标题、艺术家、流派、标签、播放次数打标与关联的主表genres.csv163 个流派的层次结构含父子关系子流派、层级分析features.csvlibrosaPython 音频特征提取库提取的标准化音频特征分类、相似度模型的输入echonest.csvSpotify 提供的专业音频特征13,129 首交叉验证、辅助特征质量上不用太担心音频均为 Creative Commons 授权研究使用无版权问题官方给出了训练/验证/测试划分直接采用就能和其他已发表工作公平对比。这套数据目前被 100 多篇论文引用。拿它做点什么从流派分类到推荐上手最常见的是流派分类标签和特征都现成from sklearn.model_selection import train_test_split from sklearn.svm import SVC X, y features.values, tracks[track][genre_top] X_train, X_test, y_train, y_test train_test_split(X, y, test_size0.2) SVC().fit(X_train, y_train)大型集合的流派分布很不均匀训练时记得过采样或换加权损失。特征分析与可视化是第二常用法预计算特征直接做模式识别和相似度计算不用回炉提特征完整流程见 analysis.ipynb。预训练迁移方面FMA 的体量够用来预训练通用音频模型迁移到小数据集后表现会有明显提升。推荐系统方面把音频特征和艺术家、标签这类元数据结合算出曲目间的相似度就能支撑个性化推荐。容易踩的坑磁盘、内存、依赖三个坑都在数据量上来之后出现按磁盘、内存、依赖的顺序挨个看。磁盘空间完整集879GB解包需要约 1TB 空闲磁盘空间不足会解到一半失败 → 解包前先查空闲容量大文件用 7zip 一类工具处理也可以分批下载和解包内存特征矩阵一次读进内存很容易撑爆 → 用 pandas 的 chunksize 分批读或改用 Dask、Vaex特征矩阵可换稀疏表示依赖冲突pip 一把装完互相打架 → 用虚拟环境隔离项目按 requirements.txt 的版本来或改用 conda 管理继续往下走流程跑通之后剩下的事是选方向。仓库自带三个 notebook各管一段usage.ipynb快速上手数据怎么加载、流程怎么走analysis.ipynb数据探索与特征可视化baselines.ipynb流派识别基准模型拿来和自己的结果对账进阶方向有三个比较常见把模型换成 CNN、RNN、Transformer 这类音频架构做多模态音频特征搭配文本元数据用未标记数据做自监督预训练。建议还是从 7.2GB 小型版起步流程走通、和 baselines 对个账再往大版本扩。跑通且结果可比就可以往下做了。【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表