Evaluar las top-20 recomendaciones para ~100k usuarios de flow desde feedback implícito
Poca disponibilidad personal para la competencia

Evaluar el uso del dataset para las clases de Organización de Datos, cátedra Collinet ✨📚
Teníamos que idear una solución que pudiera generar las recomendaciones en un tiempo aceptable
Queríamos salir del molde y probar ideas nuevas que nos resultaran interesantes 🧠
serendipia es considerado mejorscore alcanzado en test: 0.031757233518683224
score alcanzando en test: 0.03327874393933289
from surprise import NMF
Descartado por consumir RAM excesiva (40+GB)

from lightfm import LightFM
Enfoque basado en Factorization machines (paper)
Representaciones implicítas de usuarios e ítems

aggregation method
n_components
max_sampled
lr
epochs
score alcanzado en test: 0.04172341550928344
Wall time: 20min 10s
(Dell XPS 9560 - Intel® Core™ i7-7700HQ CPU @ 2.80GHz × 8 - 16 GB RAM - SSD - Fedora 34 - python38)
Se puede correr como batch en airflow
Clustering si la base de usuarios escala!
Encoding de secuencia de entrada $I$ y de salida $O$ con attention y convoluciones
$\underset{o \in O}{\arg\max}\,\textit{Model}(I, O)$



LightFM fue el sweet spot del tradeoff entre resultados y escalabilidadIgnacio Javier Mermet - ML Engineer @ Mutt Data
Gianmarco Cafferata - Data Scientist @ Mercado libre