Python+Django实现电影推荐系统:协同过滤算法详解

发布时间:2026/7/22 12:03:00
Python+Django实现电影推荐系统:协同过滤算法详解 1. 项目概述在线电影推荐系统的技术实现这个基于PythonDjangoMySQL的电影推荐系统核心在于实现了两种协同过滤算法用户协同过滤(UserCF)和物品协同过滤(ItemCF)。系统通过分析用户历史行为数据建立用户-电影评分矩阵计算用户/物品相似度最终生成个性化推荐列表。我在实际开发中发现Django的MTV架构特别适合这类数据密集型应用。通过自定义的推荐算法模块与Django视图层对接前端用Bootstrap实现响应式布局整个系统可以在2周内完成基础开发。关键在于合理设计MySQL的表结构来存储用户行为数据——我采用了星型 schema事实表保存用户评分维度表分别存储用户和电影属性。2. 核心算法解析与实现2.1 用户协同过滤实现细节用户协同过滤的核心是找到相似用户群体。我们首先构建用户-电影评分矩阵然后计算用户间的余弦相似度def user_similarity(user1, user2): # 获取共同评分过的电影 common_movies set(user1.ratings.keys()) set(user2.ratings.keys()) # 计算余弦相似度 numerator sum(user1.ratings[m] * user2.ratings[m] for m in common_movies) sum1 sum(pow(user1.ratings[m], 2) for m in user1.ratings) sum2 sum(pow(user2.ratings[m], 2) for m in user2.ratings) denominator sqrt(sum1) * sqrt(sum2) return numerator / denominator if denominator ! 0 else 0注意实际生产环境需要对稀疏矩阵进行优化可以使用稀疏矩阵存储或者降维技术2.2 物品协同过滤优化方案物品协同过滤的关键在于预先计算物品相似度矩阵。我们采用改进的余弦相似度计算def item_similarity(movie1, movie2): # 获取对两部电影都评过分的用户 common_users set(movie1.raters.keys()) set(movie2.raters.keys()) # 计算调整后的余弦相似度 avg_rating {uid: user_avg_rating[uid] for uid in common_users} numerator sum((movie1.raters[u]-avg_rating[u])*(movie2.raters[u]-avg_rating[u]) for u in common_users) sum1 sum(pow(movie1.raters[u]-avg_rating[u], 2) for u in common_users) sum2 sum(pow(movie2.raters[u]-avg_rating[u], 2) for u in common_users) denominator sqrt(sum1) * sqrt(sum2) return numerator / denominator if denominator ! 0 else 03. 数据库设计与性能优化3.1 MySQL表结构设计CREATE TABLE user ( user_id int(11) NOT NULL AUTO_INCREMENT, username varchar(50) NOT NULL, age int(11) DEFAULT NULL, gender char(1) DEFAULT NULL, PRIMARY KEY (user_id) ) ENGINEInnoDB DEFAULT CHARSETutf8mb4; CREATE TABLE movie ( movie_id int(11) NOT NULL AUTO_INCREMENT, title varchar(100) NOT NULL, genres varchar(100) DEFAULT NULL, year int(11) DEFAULT NULL, PRIMARY KEY (movie_id) ) ENGINEInnoDB DEFAULT CHARSETutf8mb4; CREATE TABLE rating ( id int(11) NOT NULL AUTO_INCREMENT, user_id int(11) NOT NULL, movie_id int(11) NOT NULL, rating float NOT NULL, timestamp bigint(20) DEFAULT NULL, PRIMARY KEY (id), KEY idx_user (user_id), KEY idx_movie (movie_id) ) ENGINEInnoDB DEFAULT CHARSETutf8mb4;3.2 查询优化技巧为频繁查询的字段建立复合索引ALTER TABLE rating ADD INDEX idx_user_movie (user_id, movie_id);使用批量插入代替单条插入# 错误做法 for rating in ratings: Rating.objects.create(**rating) # 正确做法 Rating.objects.bulk_create([ Rating(**r) for r in ratings ])对大表进行分表处理可以按用户ID范围或时间维度分表4. Django工程实践要点4.1 项目结构组织movie_recommend/ ├── apps/ │ ├── recommender/ # 推荐算法核心 │ ├── user/ # 用户管理 │ └── movie/ # 电影数据管理 ├── config/ # 项目配置 ├── static/ # 静态文件 └── templates/ # 前端模板4.2 关键视图实现from django.views.decorators.cache import cache_page cache_page(60 * 15) # 缓存15分钟 def recommend_for_user(request, user_id): user get_object_or_404(User, pkuser_id) # 获取推荐结果 if request.GET.get(algo) itemcf: movies itemcf_recommend(user) else: movies usercf_recommend(user) # 分页处理 paginator Paginator(movies, 20) page request.GET.get(page) return render(request, recommend/list.html, { movies: paginator.get_page(page), algo: request.GET.get(algo, usercf) })5. 部署与性能调优5.1 生产环境部署方案使用GunicornNginx部署Django应用gunicorn --workers4 --bind 0.0.0.0:8000 config.wsgi:applicationMySQL配置优化[mysqld] innodb_buffer_pool_size 2G # 设置为可用内存的50-70% innodb_log_file_size 256M innodb_flush_log_at_trx_commit 2 # 平衡性能与安全性使用Redis缓存推荐结果CACHES { default: { BACKEND: django_redis.cache.RedisCache, LOCATION: redis://127.0.0.1:6379/1, OPTIONS: { CLIENT_CLASS: django_redis.client.DefaultClient, } } }5.2 推荐结果更新策略全量更新每天凌晨通过Celery定时任务重新计算相似度矩阵增量更新用户新评分后只更新受影响的部分相似度关系混合策略小规模增量更新夜间全量校验6. 常见问题与解决方案6.1 冷启动问题对于新用户采用热门电影推荐要求用户选择兴趣标签使用基于内容的推荐作为过渡对于新电影结合电影元数据类型、导演等进行内容相似度计算采用编辑推荐方式人工介入6.2 稀疏性问题数据稀疏引入隐语义模型(LFM)补充协同过滤使用矩阵分解技术降维代码示例from surprise import SVD def train_svd_model(ratings): reader surprise.Reader(rating_scale(1, 5)) data surprise.Dataset.load_from_df(ratings[[user_id, movie_id, rating]], reader) algo SVD(n_factors50, n_epochs20) trainset data.build_full_trainset() algo.fit(trainset) return algo7. 前端交互实现7.1 评分组件实现$(.star-rating).click(function() { const movieId $(this).data(movie-id); const rating $(this).data(rating); $.ajax({ url: /api/rate/, method: POST, data: { movie_id: movieId, rating: rating, csrfmiddlewaretoken: $(input[namecsrfmiddlewaretoken]).val() }, success: function() { // 更新UI } }); });7.2 实时推荐加载function loadRecommendations() { const algo $(#algorithm-selector).val(); $.get(/recommend/?algo${algo}, function(data) { $(#recommendations-container).html(data); }); } // 使用防抖优化频繁请求 $(#algorithm-selector).change(_.debounce(loadRecommendations, 300));8. 项目扩展方向混合推荐策略协同过滤 内容推荐实时行为 长期兴趣模型深度学习应用使用神经网络学习用户表示序列模型捕捉用户兴趣演化多模态推荐结合电影海报视觉特征利用影评文本情感分析我在实际开发中发现初期应该聚焦核心推荐算法的准确性使用RMSE等指标持续评估改进。当基础推荐效果稳定后再逐步引入更复杂的策略。部署时特别注意缓存策略推荐结果计算开销大但时效性要求相对较低非常适合缓存。