回复: 10
跳转到指定楼层
上一主题 下一主题
收起左侧

Machine Learning Design的框架,欢迎讨论

   
全局:

2020(7-9月) MachineLearningEng 硕士 全职@meta - 猎头 - 视频面试  | | Other | 在职跳槽
本帖最后由 wwx_27 于 2020-10-2 23:40 编辑

自己整理了一个Machine Learning System Design的基础框架,从preprocessing到最后model evaluation,以page recommendation为例,欢迎大家讨论,补充跟指正。

Scenario: Clarify question/senario/feature/background
System goal: Clarify metrics

Data extraction:
1.target variable construction:
•        Deduplication
•        EDA(0,1 ratio), imbalance data
2. Feature engineering:
•        What should be feature: page metadata, user metadata, friend metadata
•        Important feature distribution

Preprocessing(why preprocess): 1. Text embedding 2. Categorical feature 3. Date Parse 4. Missing value 5. Outlier detector

Model selection: There are 3 widely-use classification model
Logistic regression is a linear classifier(linear combination + sigmoid function(Monotonically increasing)). The model output is the predicted probability of label being 1. It requires assumptions: each data point independent. No correlation between features. It’s
您好!
本帖隐藏的内容需要积分高于 188 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 188 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限 或 查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
le data set.
Model Calibration if necessary.
  • Online evaluation
Before model deployment, I would do a A/B test to compare existing policy and using new model as recommendation policy.
Metrics: num of like
Two proportion sample test, z statics, 5% significant level

Model iteration:
•        Batch model: monthly retrain, better solution is to monitor AUC
•        Online retrain: using latest hour/daily data to partially update model parameter (add a tree with smaller learning rate)












本帖子中包含更多资源

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x

评分

参与人数 27大米 +36 收起 理由
bushimajia + 1 很有用的信息!
asyz13jinage + 1 很有用的信息!
lyft + 2 给你点个赞!
wkz3186 + 1 赞一个
dustbin + 2 给你点个赞!

查看全部评分


上一篇:IBM Data Scientist - Chief Analyst Office
下一篇:databricks 新鲜面经

本帖被以下淘专辑推荐:

推荐
yangshao 2020-10-28 03:21:56 | 只看该作者
全局:
wwx_27 发表于 2020-10-4 23:25
Normalize data只在linear model中比较有用,比如linear regression和logistics regression,不过欢迎继 ...

nn里也需要,不然loss shape会比较难看,优化起来困难。
回复

使用道具 举报

推荐
 楼主| wwx_27 2020-10-4 23:25:00 | 只看该作者
全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限 或 查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies

评分

参与人数 1大米 +1 收起 理由
biorainy + 1 赞一个

查看全部评分

回复

使用道具 举报

地里匿名用户
推荐
匿名用户-VYUYU  2020-10-4 08:45:02 来自APP
Preprocessing 可能还需要做standardization跟normalize data
回复

使用道具 举报

全局:
谢谢楼主分享干货
回复

使用道具 举报

🔗
jxlin 2020-10-3 05:20:06 | 只看该作者
本楼:
全局:
Thank you!!
回复

使用道具 举报

🔗
jimmy12day 2020-10-7 08:34:55 | 只看该作者
全局:
谢谢分享,干活满满
回复

使用道具 举报

全局:
您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
使用VIP即刻解锁阅读权限或查看其他获取积分的方式
游客,您好!
本帖隐藏的内容需要积分高于 100 才可浏览
您当前积分为 0。
VIP即刻解锁阅读权限 或 查看其他获取积分的方式
Unlock interview details and practice with AI
Curated Interview Questions from Top Companies
回复

使用道具 举报

🔗
transcendence 2020-10-28 01:43:07 | 只看该作者
全局:
Data generation 这块可能还要考虑下用什么data 做training, label 是什么,
Metrics 这块如果是个ranking problem, 那就不仅是AUC,要用些专用的metric 比如 MAP@K , NDCG
回复

使用道具 举报

🔗
 楼主| wwx_27 2020-10-28 02:00:52 | 只看该作者
全局:
transcendence 发表于 2020-10-28 01:43
Data generation 这块可能还要考虑下用什么data 做training, label 是什么,
Metrics 这块如果是个rankin ...

ranking problem值得仔细讨论,欢迎添加NDCG的细节
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表