5.3 非关系型数据库存储

NoSQL,全称 Not Only SQL,意为不仅仅是 SQL,泛指非关系型的数据库。NoSQL 是基于键值对的,而且不需要经过 SQL 层的解析,数据之间没有耦合性,性能非常高。

非关系型数据库又可以细分如下:

  • 键值存储数据库,代表有 Redis, Voldemort, Oracle BDB 等。
  • 列存储数据库,代表有 Cassandra, HBase, Riak 等。
  • 文档型数据库,代表有 CouchDB, MongoDB 等。
  • 图形数据库,代表有 Neo4J, InfoGrid, Infinite Graph等。

对于爬虫的数据存储来说,一条数据可能存在某些字段提取失败而缺失的情况,而且数据可能随时调整,另外数据之间能还存在嵌套关系。如果我们使用了关系型数据库存储,一是需要提前建表,二是如果存在数据嵌套关系的话需要进行序列化操作才可以存储,比较不方便。如果用了非关系数据库就可以避免一些麻烦,简单高效。

本节我们主要介绍一下 MongoDB 和 Redis 的数据存储操作。

results matching ""

    No results matching ""