Python+Spotify API打造个性化音乐分析工具
📅 2026/8/3 7:49:59
👁️ 阅读次数
📝 编程学习
1. 项目概述:用Python解锁你的Spotify音乐DNA
去年冬天整理年度歌单时,我发现Spotify的年度回顾功能虽然精美,但数据维度实在太有限。作为常年日均听歌4小时的重度用户,我决定用Python把自己的播放记录扒个底朝天。这个项目不需要复杂的爬虫技术,Spotify官方API对个人开发者非常友好,只需要30行核心代码就能提取包括歌曲特征、收听时段、艺人国籍等20+维度的数据。
2. 环境准备与API配置
2.1 开发环境搭建
推荐使用Python 3.8+版本,主要依赖库包括:
pip install spotipy pandas matplotlib seaborn- spotipy:Spotify官方Python SDK(1.2MB)
- pandas:数据处理核心工具(15MB)
- matplotlib/seaborn:可视化黄金组合(8MB)
注意:国内安装可能遇到SSL证书问题,建议先升级pip并配置清华镜像源
2.2 Spotify开发者账号申请
- 登录 Spotify开发者仪表盘
- 创建新应用(类型选"Personal Use")
- 记录下Client ID和Client Secret
- 在设置中添加回调地址:
http://localhost:8888/callback
3. 核心数据抓取实现
3.1 认证流程封装
import spotipy from spotipy.oauth2 import SpotifyOAuth scope = "user-library-read user-top-read user-read-recently-played" sp = spotipy.Spotify(auth_manager=SpotifyOAuth( client_id="YOUR_CLIENT_ID", client_secret="YOUR_CLIENT_SECRET", redirect_uri="http://localhost:8888/callback", scope=scope))3.2 关键数据端点解析
| 端点 | 数据量 | 示例用途 |
|---|---|---|
| /me/top/{type} | 50条 | 分析长期偏好 |
| /me/player/recently-played | 50条 | 短期行为分析 |
| audio-features/{id} | 单曲 | 音乐特征工程 |
3.3 完整数据采集示例
def get_audio_features(track_ids): features = [] for i in range(0, len(track_ids), 50): batch = track_ids[i:i + 50] features += sp.audio_features(batch) return pd.DataFrame(features) top_tracks = sp.current_user_top_tracks(limit=50, time_range='long_term') track_ids = [item['id'] for item in top_tracks['items']] audio_df = get_audio_features(track_ids)4. 数据分析与可视化实战
4.1 音乐特征雷达图
import matplotlib.pyplot as plt features = ['danceability', 'energy', 'speechiness', 'acousticness', 'instrumentalness', 'liveness'] plt.figure(figsize=(10,6)) for i in range(3): values = audio_df.iloc[i][features].tolist() values += values[:1] # 闭合雷达图 angles = [n / float(len(features)) * 2 * pi for n in range(len(features))] angles += angles[:1] plt.polar(angles, values, linewidth=1, linestyle='solid', label=audio_df.iloc[i]['name'])4.2 收听时间模式分析
recent_plays = sp.current_user_recently_played(limit=50) play_hours = [datetime.strptime(item['played_at'], '%Y-%m-%dT%H:%M:%S.%fZ').hour for item in recent_plays['items']] plt.hist(play_hours, bins=24, edgecolor='black') plt.xticks(range(24)) plt.title('Daily Listening Pattern')5. 高级技巧与避坑指南
5.1 速率限制应对策略
- 默认限制:30请求/秒
- 建议添加延时:
time.sleep(0.5)between batches - 错误处理模板:
try: response = sp.current_user_saved_tracks() except spotipy.exceptions.SpotifyException as e: if e.http_status == 429: retry_after = int(e.headers['Retry-After']) time.sleep(retry_after)5.2 数据持久化方案
推荐使用SQLite存储历史数据:
import sqlite3 conn = sqlite3.connect('spotify_data.db') audio_df.to_sql('audio_features', conn, if_exists='append', index=False)6. 创意分析方向拓展
6.1 音乐口味变迁分析
通过对比不同time_range参数获取的数据:
- short_term(4周)
- medium_term(6个月)
- long_term(数年)
6.2 艺人关系网络图
使用NetworkX库构建:
import networkx as nx G = nx.Graph() for artist in related_artists: G.add_edge(main_artist, artist['name'], weight=artist['popularity']) nx.draw(G, with_labels=True, node_size=50)我在持续分析自己3年的收听数据后,发现几个反直觉的结论:工作日反而比周末听更多电子音乐,雨天会显著提高古典乐播放量。这些洞察用现成的年度回顾永远无法获得。建议每月运行一次脚本建立时间序列数据集,你会惊讶于自己音乐品味的微妙变化规律。
编程学习
技术分享
实战经验