好湿?好紧?好多水好爽自慰,久久久噜久噜久久综合,成人做爰A片免费看黄冈,机机对机机30分钟无遮挡

主頁 > 知識庫 > Instagram提升PostgreSQL性能的五個技巧

Instagram提升PostgreSQL性能的五個技巧

熱門標簽:湖南保險智能外呼系統產品介紹 小程序智能電話機器人 怎么去開發一個電銷機器人 怎么申請400熱線電話 泗洪正規電話機器人找哪家 南昌呼叫中心外呼系統哪家好 河北便宜電銷機器人軟件 ai電話電話機器人 簡單的智能語音電銷機器人

 隨著Instagram的規模日益擴大,Postgres繼續充當著Instagram的堅實基礎,并存儲著絕大部分的用戶數據。不到一年之前,我們還曾在博客上說Instagram“存儲著大量數據”,每秒增加90條數據,現在,這個數據已經增長到了峰值的10000條。而我們的基礎存儲技術依然保持不變。

在過去的兩年半中,我們有一些關于Postgres擴展的經驗和工具,想要分享出來。真希望在當初啟動Instagram的時候就能有這些經驗和工具呀。其中有些是Postgres獨有的,有些是其它數據庫也可以采用的。如果想要了解我們是如何水平分區的,可以看這篇文章。

1. 局部索引

如果我們經常需要按某個固定的特征過濾數據,而且這個特征只存在于一小部分行里,在這種情況下,局部索引非常有效。

比方說,Instagram搜索標簽的時候,我們需要找出有許多照片的標簽。我們一般會用ElasticSearch之類的技術來進行高級搜索,不過這里只靠數據庫的查詢能力就完全夠了。先來看一下,按標簽查詢,并按照片數排序,Postgres是怎么做的:
 

EXPLAIN ANALYZE SELECT id from tags WHERE name LIKE 'snow%' ORDER BY media_count DESC LIMIT 10;   
QUERY PLAN 
---------                                 
 Limit (cost=1780.73..1780.75 rows=10 width=32) (actual time=215.211..215.228 rows=10 loops=1)
  -> Sort (cost=1780.73..1819.36 rows=15455 width=32) (actual time=215.209..215.215 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_search on tags_tag (cost=0.00..1446.75 rows=15455 width=32) (actual time=0.020..162.708 rows=64572 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 215.275 ms
(8 rows)

有沒有看到,為了得到結果,Postgres不得不對15000行數據進行排序。由于標簽的分布滿足長尾模式(譯者注: 根據百度百科,「我們常用的漢字實際上不多,但因出現頻次高,所以這些為數不多的漢字占據了上圖廣大的紅區;絕大部分的漢字難得一用,它們就屬于那長長的黃尾?!?,我們可以改為查詢超過100張照片的標簽,先建局部索引:
 
CREATE INDEX CONCURRENTLY on tags (name text_pattern_ops) WHERE media_count >= 100
然后查詢,看一下新的查詢計劃:
 

EXPLAIN ANALYZE SELECT * from tags WHERE name LIKE 'snow%' AND media_count >= 100 ORDER BY media_count DESC LIMIT 10;
 
QUERY PLAN
 Limit (cost=224.73..224.75 rows=10 width=32) (actual time=3.088..3.105 rows=10 loops=1)
  -> Sort (cost=224.73..225.15 rows=169 width=32) (actual time=3.086..3.090 rows=10 loops=1)
     Sort Key: media_count
     Sort Method: top-N heapsort Memory: 25kB
     -> Index Scan using tags_tag_name_idx on tags_tag (cost=0.00..221.07 rows=169 width=32) (actual time=0.021..2.360 rows=924 loops=1)
        Index Cond: (((name)::text ~>=~ 'snow'::text) AND ((name)::text ~~ 'snox'::text))
        Filter: ((name)::text ~~ 'snow%'::text)
 Total runtime: 3.137 ms
(8 rows)

可以看到,Postgres只需要訪問169行,所以速度快得多。Postgres的查詢計劃器對約束的評估也很有效。如果以后想要查詢超過500張照片的標簽,由于這個結果集是上面集合的子集,所以仍然會使用這個局部索引。

2. 函數索引

在某些表上,我們需要對一些很長的字符串建立索引,比如說,64個字符的base64記號。如果直接建索引的話,會造成大量的數據重復,這種情況下,可以用Postgres的函數索引:
 

CREATE INDEX CONCURRENTLY on tokens (substr(token), 0, 8)

雖然這樣會造成許多行匹配相同的前綴,但我們可以在匹配的基礎上再用過濾,速度很快。而且索引很小,只有大概原來的十分之一。

3. 用pg_reorg來讓數據更緊湊

隨著時間的流逝,Postgres的表會變得越來越零碎(由MVCC并發模型等原因引起)。而且,數據行插入的順序往往也不是我們希望返回的順序。比如說,如果我們經常要按用戶來查詢照片等,那么最好是在磁盤上把這些東西放在一起,這樣就可以減少磁盤尋道的時間。

我們用pg_reorg來解決這個問題,它用三個步驟來讓“壓緊”一個表:

  1.     取得表的獨占鎖
  2.     建一個記錄變更的臨時表,在原始表上加一個觸發器,把對原始表的變更復制到臨時表上
  3.     用CREATE TABLE...SELECT FROM...ORDER BY建表,新表擁有原始表的全部數據,而且是按索引順序排序的
  4.     將CREATE TABLE執行時間點以后發生的變更從臨時表同步過來
  5.     業務切換到新表

每一步都會有很多細節,不過大體上就是像上面這個樣子。我們先對這個工具進行了一些審查,運行了若干測試,然后再把它用到生產環境上?,F在,我們已經在幾百臺機器的環境上跑過幾十次pg_reorg,沒出現過任何問題。


4. 用WAL-E進行WAL(寫前日志)的歸檔和備份

我們用WAL-E來歸檔WAL日志,它是Heroku寫的一個工具,我們也向它貢獻了一部分代碼。WAL-E大大簡化了數據備份和復制庫創建的過程。

WAL-E是利用Progres的archive_command,將PG產生的每個WAL文件都歸檔到Amazon的S3。利用這些WAL文件和數據庫的基準備份,我們可以將數據庫恢復到基準備份后任何一個時間點的狀態。利用這個手段,我們也可以快速創建只讀的復制庫或故障備用庫。

我們為WAL-E寫了一個簡單的封裝腳本,可以監控歸檔時的重復故障,見GitHub。
 
5. psycopg2中的自動提交模式和異步模式

我們也開始用psycopg2中的一些高級功能(psycopg2是Postgres的Python驅動)。

一個是自動提交模式。在這個模式里,psycopg2不會發出BEGIN/COMMIT,每個查詢跑在自己的單語句事務里。這對不需要事務的只讀查詢特別有用。開啟很簡單:

connection.autocommit = True

開啟自動提交后,我們的應用服務器和數據庫之間的對話大減,數據庫服務器的CPU用量也大減。而且,我們是用PGBouncer作為連接池,開啟自動提交后,連接的歸還也更快了。

與Django的交互細節可以看這里。


psycopg2還有一個很有用的功能,它可以通過注冊一個等待回調(wait callback)函數,提供協同程序(coroutine)支持。它可以支持跨連接查詢,對命中多個節點的查詢非常有用,當有數據時,socket會被喚醒(我們利用Python的select模塊來處理喚醒)。它也可以與eventlet和gevent等多線程庫很好的協作,參考實現可見psycogreen。

總的來說,我們對Postgres的高性能和可靠性十分滿意。想在世界上最大之一的Postgres集群上工作嗎?想跟一群基礎設施高手們一起干活嗎?請聯系infrajobs@instagram.com吧。

您可能感興趣的文章:
  • PostgreSQL數據庫服務端監聽設置及客戶端連接方法教程
  • CentOS中運行PostgreSQL需要修改的內核參數及配置腳本分享
  • PostgreSQL ERROR: invalid escape string 解決辦法

標簽:荊門 景德鎮 江蘇 淮安 柳州 那曲 瀘州 威海

巨人網絡通訊聲明:本文標題《Instagram提升PostgreSQL性能的五個技巧》,本文關鍵詞  Instagram,提升,PostgreSQL,性能,;如發現本文內容存在版權問題,煩請提供相關信息告之我們,我們將及時溝通與處理。本站內容系統采集于網絡,涉及言論、版權與本站無關。
  • 相關文章
  • 下面列出與本文章《Instagram提升PostgreSQL性能的五個技巧》相關的同類信息!
  • 本頁收集關于Instagram提升PostgreSQL性能的五個技巧的相關信息資訊供網民參考!
  • 推薦文章
    主站蜘蛛池模板: 91免费精品国自产拍在线不卡 | 在线免费看a| 偷窥亚洲女厕毛茸茸| 女被?到爽??流片调教捆绑| 色屁屁www免费看视频影院| 美女的隐私免费看无遮挡| 男女一级做片a性视频| 免费古装一级婬片潘金莲| 日韩福利视频| 99pao在线视频成精品| 亚洲AV电影天堂男人的天堂| 小男生h| 澡人人澡人澡人人澡天天| 欧洲、亚洲、国产AV男人的天堂 | 狠狠天天| 男女一进一出激情视频| 亚洲一区二区三区女厕偷拍| 女友哀羞4部曲阅读| 黄色视频下载| 91精品福利老司机在线观看| 一区二区三区精品视频| 色图在线观看| 性德国高清xxxxbbbb| 往下边塞玉器洛灵犀| 大学生特殊的按摩精油| 乱色欧美videos黑人| 亚洲欧美一区二区三区二厂| 韩国朴恩率跳舞露下毛| 全彩小太正榨精本子h| 最新怡春院| 亚洲优优色影影院| 在线看片黄| 日本大香焦| 欧美va在线播放免费观看| 色婷婷AV99XX天美| 女公浴室XXX偷窃WWW| 欧美丰满大乳大屁在线观看股| 亚洲国产欧洲综合997久久,| 我脱了女邻居的奶罩| 女人张开腿让男人插| 国产精品久久久久欧美 |