|
|
1
29
如果数据已发布,则互联网上的每个人都可以看到和访问它。这包括你想看的人和你不想看的人。 你不能两者兼得。您可以这样做,以便数据只能在帐户中可见,并且人们会通过帐户来窃取数据。您可以这样做,以便数据只能从已批准的IP地址中可见,并且人们将通过步骤获得批准,然后再将其删除。 是的,你可以让它很难得到,但是如果你想让它对典型的用户方便,你也需要让它对恶意的用户方便。 |
|
|
2
45
虽然没有什么可以阻止一个有决心的人去搜集公开可用的内容,但是您可以做一些基本的事情来减轻客户的顾虑:
威慑程度不同,第一种选择可能是最不具侵入性的。 |
|
|
3
11
虽然没有一种方法是理想的,但你能做到的方法很少。
|
|
|
4
7
尝试在前端使用flash或silverlight。 虽然这不能阻止一个人,如果他们真的下定决心,这将是更困难的。如果您通过服务加载数据,则可以始终使用安全连接来防止中间人抓取。 |
|
5
5
你真的无能为力。你可以尝试寻找一个通过你的网站的自动化过程,但最终他们会赢。 经验法则:如果你想保留一些东西给自己,就不要让它上网。 |
|
|
6
5
为每个唯一的IP每10页加载一次recaptcha |
|
|
7
3
把你的手从键盘上拿开,问你的客户原因。 为什么 他希望数据是可见的,但不能被擦除? 他要求两件不一致的事情,也许就他的推理进行讨论会产生一些成果。 可能他真的不希望它公开访问,您需要添加身份验证/授权。或者,他可能会认为实际打开一个API是有价值的。但除非你问,否则你不会知道。 |
|
|
8
2
我不知道你为什么要阻止这件事。客户提供数据。 假设它们以某种独特的方式创造价值,而不是以琐碎的方式反映在数据中。 不管怎样。 你可以检查浏览器,屏幕分辨率和IP地址,看看它是否有可能是某种自动刮刀。 大多数东西,比如curl和wget——除非经过仔细配置——显然不是浏览器。 |
|
|
9
2
使用类似于AdobeFlex(一个Flash应用程序前端)的工具可以解决这个问题。 除此之外,如果你想让用户更容易访问,用户也很容易复制。 |
|
|
10
1
对此没有简单的解决方案。如果数据是公开的,那么它就可以被抓取。唯一能做的就是通过添加/更改HTML而不影响布局,使每个条目稍微独特,从而使scraper的生活更加困难。这可能会使使用正则表达式获取数据变得更加困难,但这仍然不是一个真正的解决方案,我想说,任何有足够决心的人都会找到解决方法。 我建议你告诉你的客户这是一项无法完成的任务,继续你工作的重要部分。 |
|
|
11
0
创造类似于布告栏的巨魔保护的东西怎么样?如果检测到一个抓取(可能是每分钟从一个IP进行一定数量的访问,或者是一个看起来像站点地图抓取的定向抓取),那么您就可以开始显示垃圾数据,比如更改电话号码的几个数字,或者在名称字段中添加一些愚蠢的名称。 为Google IP关闭此功能! |
|
|
12
0
通常情况下,为了筛选出一个合适的数量,你必须向你的服务器发出成百上千(甚至更多)的请求。我建议您阅读相关的堆栈溢出问题: How do you stop scripters from slamming your website hundreds of times a second? |
|
|
13
0
使用这样一个事实:scraper倾向于快速连续加载多个页面来检测scraper行为。每N页加载x秒显示一个验证码,并且/或者包括每一页加载的指数增长延迟,当每分钟加载数十页时,延迟会变得相当长。 这样,普通用户可能永远看不到您的验证码,但抓取程序将很快达到限制,迫使他们解决验证码。 |
|
|
14
-3
我的建议是,这无论如何都是非法的,所以如果有人盗取了网站,至少你有法律上的追索权。因此,最好的做法可能只是包含一个链接到原始网站,让人们刮掉。他们刮得越多,你的链接就会越多地出现在互联网周围,越来越多地建立你的网页排名。 刮伤的人通常并不反对包含到原始网站的链接,因为它建立了一种与原始作者的融洽关系。 所以我的建议是问你的老板这是否真的是对网站健康最好的事情。 |
|
|
blogger13 · 视频租赁店数据库的规范化 1 年前 |
|
|
ì¤ì¤í · 为什么LEFT INNER JOIN被弃用? 1 年前 |
|
|
relatively_random · 确保两个表之间一致的共同参考 1 年前 |
|
|
Grenish Rai · Firestore错误“用户文档不存在” 2 年前 |
|
|
Saijo-Shi · PLpgsql中的更新触发器 2 年前 |
|
Dante · Django::配置不当:池不支持持久连接 2 年前 |
|
YouLocalRUser · 删除重复行,保留第一行 2 年前 |