微博和Twitter都有140字数的限制如果分享一个长网址,很容易就超出限制发布出去。短网址服务可以把一个长网址变成短网址方便在社交网络上传播。
很显然要尽可能的短。长度设计为多少才合适呢
当前互联网上的网页总数大概是 45亿(参考 ),45亿超过了 2^{32}=2=但远远小于64位整数的上限值,那么用一个64位整数足够叻微博的短网址服务用的是长度为7的字符串,这个字符串可以看做是62进制的数那么最大能表示{62}^7=606208个网址,远远大于45亿所以长度为7就足夠了。一个64位整数如何转化为字符串呢,假设我们只是用大小写字母加数字那么可以看做是62进制数,log_{62{(2^{64}-1)=10.7log62(264?1)=10.7即字符串最长11就足够了。实際生产中还可以再短一点,比如新浪微博采用的长度就是7因为 62^7=606208,这个量级远远超过互联网上的URL总数了绝对够用了。现代的web服务器(唎如Apache, Nginx)大部分都区分URL里的大小写了所以用大小写字母来区分不同的URL是没问题的。因此正确***:长度不超过7的字符串,由大小写字母加数字共62个字母组成
四、一对一还是一对多映射?
一个长网址对应一个短网址,还是可以对应多个短网址 这也是个重大选择问题。┅般而言一个长网址,在不同的地点不同的用户等情况下,生成的短网址应该不一样这样,在后端数据库中可以更好的进行数据汾析。如果一个长网址与一个短网址一一对应那么在数据库中,仅有一行数据无法区分不同的来源,就无法做数据分析了
以这个7位長度的短网址作为唯一ID,这个ID下可以挂各种信息比如生成该网址的用户名,所在网站HTTP头部的 User Agent等信息,收集了这些信息才有可能在后媔做大数据分析,挖掘数据的价值短网址服务商的一大盈利来源就是这些数据。
现在我们设定了短网址是一个长度为7的字符串如何计算得到这个短网址呢?
最容易想到的办法是哈希先hash得到一个64位整数,将它转化为62进制整截取低7位即可。但是哈希算法会有冲突如何處理冲突呢,又是一个麻烦这个方法只是转移了矛盾,没有解决矛盾抛弃。
如果存储短网址和长网址的对应关系以短网址为 primary key, 长网址為value, 可以用传统的关系数据库存起来,例如MySQL,PostgreSQL也可以用任意一个分布式KV数据库,例如Redis, LevelDB
如果你手痒想要手工设计这个存储,那就是另一个话題了你需要完整地造一个KV存储引擎轮子。当前流行的KV存储引擎有LevelDB何RockDB去读它们的源码。
七、301还是302重定向
这也是一个有意思的问题这个問题主要是考察你对301和302的理解,以及浏览器缓存机制的理解
301是永久重定向,302是临时重定向短地址一经生成就不会变化,所以用301是符合http語义的但是如果用了301, Google百度等搜索引擎,搜索的时候会直接展示真实地址那我们就无法统计到短地址被点击的次数了,也无法收集鼡户的Cookie, User Agent 等信息这些信息可以用来做很多有意思的大数据分析,也是短网址服务商的主要盈利来源所以,正确***是302重定向
可以抓包看看mrw.so的短网址是怎么做的,使用 Chrome 浏览器访问这个URL
如果一些别有用心的黑客,短时间内向TinyURL服务器发送大量的请求会迅速耗光ID,怎么办呢
首先,限制IP的单日请求总数超过阈值则直接拒绝服务。光限制IP的请求数还不够因为黑客一般手里有上百万台肉鸡的,IP地址大大的有所以光限制IP作用不大。
可以用一台Redis作为缓存服务器存储的不是 ID->长网址,而是 长网址->ID仅存储一天以内的数据,用LRU机制进行淘汰这样,如果黑客大量发同一个长网址过来直接从缓存服务器里返回短网址即可,他就无法耗光我们的ID了