采集方针
我们读取什么、以什么速度读取、以及我们拒绝承接的请求。因为法务一定会先问这个。
这一页不是套话。它描述软件实际执行的行为,其中写着「我们拒绝」的部分, 是在代码里强制执行的,而不是在文字里承诺的。
我们读取什么
公开的商品列表页 —— 与购物者不登录即可看到的页面相同。价格、标题、在售状态,以及发布该商品的卖家身份。
读取前我们检查什么
每一次都检查 robots.txt。 被禁止的路径不会被抓取。站点公布了 crawl-delay 的,该值就是下限;未公布的,我们自行设定一个并按来源逐一记录。
响应本身。 返回 403 或 429 的站点是在拒绝。我们记录这次拒绝及其日期,停止,并且不再按计划重试。被拒绝的来源就保持不读。我们不会去找绕过拒绝的方法。
我们拒绝做的事
这些不是愿景。每一条在代码中都不存在,要求我们做这些的客户,我们会拒绝。
- 不伪装指纹。 我们不掩饰客户端的真实身份。
- 不绕过验证码。 验证码本身就是一个答复,而这个答复是「不」。
- 不绕过登录。 我们只读取无账号访客能看到的内容。
- 不超过对方声明的限制。 轮换地址来规避速率限制是规避,不是容量,我们不出售它。
- 不采集个人信息。 我们读取价格和商品信息。卖家是具名企业时记录该企业;商品页含有个人信息时不予保留。
除了原则,还有商业上的理由。一旦被某个来源拒绝,就再也读不回来了。 损失的不只是我们,还有每一位需要那个来源的客户。利益与伦理指向同一个方向。
我们记录什么
每一条观测都带有来源、商品网址、读取时刻、公布的价格、扣除消费税后的价格,以及所用汇率与该汇率的公布日期。这才是让一个数字可以被验算,而不只是被声明。
移除
如果你运营某个站点并且不希望我们读取,请与我们联系。我们会停止、将该来源加入拒绝清单,并删除已从中获得的内容。我们不会要求你说明理由。
最后更新