Kansoku
English日本語简体中文

本页由英文原文翻译,尚未经母语者校对。以英文版为准。 阅读英文原文

采集方针

我们读取什么、以什么速度读取、以及我们拒绝承接的请求。因为法务一定会先问这个。

这一页不是套话。它描述软件实际执行的行为,其中写着「我们拒绝」的部分, 是在代码里强制执行的,而不是在文字里承诺的。

我们读取什么

公开的商品列表页 —— 与购物者不登录即可看到的页面相同。价格、标题、在售状态,以及发布该商品的卖家身份。

读取前我们检查什么

每一次都检查 robots.txt 被禁止的路径不会被抓取。站点公布了 crawl-delay 的,该值就是下限;未公布的,我们自行设定一个并按来源逐一记录。

响应本身。 返回 403 或 429 的站点是在拒绝。我们记录这次拒绝及其日期,停止,并且不再按计划重试。被拒绝的来源就保持不读。我们不会去找绕过拒绝的方法。

我们拒绝做的事

这些不是愿景。每一条在代码中都不存在,要求我们做这些的客户,我们会拒绝。

除了原则,还有商业上的理由。一旦被某个来源拒绝,就再也读不回来了。 损失的不只是我们,还有每一位需要那个来源的客户。利益与伦理指向同一个方向。

我们记录什么

每一条观测都带有来源、商品网址、读取时刻、公布的价格、扣除消费税后的价格,以及所用汇率与该汇率的公布日期。这才是让一个数字可以被验算,而不只是被声明。

移除

如果你运营某个站点并且不希望我们读取,请与我们联系。我们会停止、将该来源加入拒绝清单,并删除已从中获得的内容。我们不会要求你说明理由。

最后更新