SparkSql学习1 —— 借助SQlite数据库分析2000万数据

总所周知,Spark在内存计算领域非常强势,是未来计算的方向。Spark支持类Sql的语法,方便我们对DataFrame的数据进行统计操作。

但是,作为初学者,我们今天暂且不讨论Spark的用法。我给自己提出了一个有意思的思维游戏:Java里面的随机数算法真的是随机的吗?

好,思路如下:

1. 取样,利用Java代码随机生成2000万条0-1000的整数(包括0,但是不包括1000)

2. 分析每个整数的出现次数。

如果出现次数分布非常均匀,那么可以证明随机数算法还是比较靠谱的。

那么,现在就动手:

第一步:编写java代码往数据库里面造数据

这里我选择的是sqlite数据库的内存模式,之所以这样选择,是因为文件型数据库的内存模式可以节省网络开销,小巧精悍:

java代码:

package com.lnwazg.dbkit.controller;

import java.sql.SQLException;
import java.util.ArrayList;
import java.util.List;

import org.apache.commons.lang3.RandomUtils;

import com.lnwazg.dbkit.dao.SqliteDao;
import com.lnwazg.dbkit.jdbc.MyJdbc;
import com.lnwazg.dbkit.proxy.MyDaoProxy;
import com.lnwazg.dbkit.utils.DbKit;
import com.lnwazg.dbkit.vo.Record;
import com.lnwazg.kit.testframework.TF;
import com.lnwazg.kit.testframework.anno.AfterFinalOnce;
import com.lnwazg.kit.testframework.anno.PrepareStartOnce;
import com.lnwazg.kit.testframework.anno.TestCase;

/**
 * 随机插入2000万条随机数
 * @author nan.li
 * @version 2016年6月2日
 */
public class SqliteTest2
{
    MyJdbc jdbc = null;
    
    SqliteDao sqliteDao = null;
    
    @PrepareStartOnce
    void prepareStartOnce()
    {
        //初始化jdbc连接
        jdbc = DbKit.getJdbc("sqlite3.properties");
        sqliteDao = MyDaoProxy.proxyDaoInterface(SqliteDao.class,jdbc);//根据接口生成动态代理类
    }
    
    @AfterFinalOnce
    void afterFinalOnce()
    {
    }
    
    @TestCase
    void doTest()
        throws SQLException
    {
        //插入2000万条数据,然后用sql计算出分布情况
        //        每次10000条记录,循环2000次
        sqliteDao.createTable(Record.class);
        for (int i = 0; i < 200; i++)
        {
            List<Record> list = new ArrayList<>();
            for (int j = 0; j < 100000; j++)
            {
                list.add(new Record().setNumber(RandomUtils.nextInt(0,1000)));//随机数,值为0-999
            }
            sqliteDao.insertBatch(list,50000);//批量插入,batchSize设置为50000
            System.out.println(String.format("第%s次插入成功!",i + 1));
        }
    }
    
    public static void main(String[] args)
    {
        TF.l(SqliteTest2.class);
    }
}

数据库配置:

url=jdbc:sqlite://d:/largeData.db
username=
password=

Record类结构:

package com.lnwazg.dbkit.vo;

import org.apache.commons.lang3.builder.ToStringBuilder;
import org.apache.commons.lang3.builder.ToStringStyle;

import com.lnwazg.dbkit.anno.AutoIncrement;
import com.lnwazg.dbkit.anno.Id;

public class Record
{
    @Id
    @AutoIncrement
    private Integer id;
    
    private Integer number;
    
    public Integer getId()
    {
        return id;
    }
    
    public Record setId(Integer id)
    {
        this.id = id;
        return this;
    }
    
    public Integer getNumber()
    {
        return number;
    }
    
    public Record setNumber(Integer number)
    {
        this.number = number;
        return this;
    }
    
    @Override
    public String toString()
    {
        return ToStringBuilder.reflectionToString(this,ToStringStyle.JSON_STYLE);
    }
    
}

好了,代码跑起来,每插入10w条数据需要消耗37秒钟,每秒钟插入成功2702条数据,这个效率我还是比较满意的。

大约等了2个钟头,全部数据就造好了,占用230MB大小。

第二步:开始分析

表结构以及数据如下:

先验证一下记录数对不对:

OK,2000万条数据,如假包换。

好了,开始分组分析:

可以看到,最小的随机数是0,最大的随机数是999。 所有的随机数的出现次数都趋近于20000次,分布情况相当均匀,最大误差不超过450。

这个数字,跟我们期待的值是一致的: 20000000条记录 / 1000种数字 = 20000条记录/种数字。

由此可以证明,java里面的随机数算法还是相当可靠的。

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐


SQLite架构简单,又有Json计算能力,有时会承担Json文件/RESTful的计算功能,但SQLite不能直接解析Json文件/RESTful,需要用Java代码硬写,或借助第三方类库,最后再拼成insert语句插入数据表,代码非常繁琐,这里就不展示了。参考前面的代码可知,入库的过程比较麻烦,不能只用SQL,还要借助Java或命令行。SPL是现代的数据计算语言,属于简化的面向对象的语言风格,有对象的概念,可以用点号访问属性并进行多步骤计算,但没有继承重载这些内容,不算彻底的面向对象语言。...
使用Python操作内置数据库SQLite以及MySQL数据库。
破解微信数据库密码,用python导出微信聊天记录
(Unity)SQLite 是一个软件库,实现了自给自足的、无服务器的、零配置的、事务性的 SQL 数据库引擎。SQLite 是在世界上最广泛部署的 SQL 数据库引擎。SQLite 源代码不受版权限制。本教程将告诉您如何使用 SQLite 编程,并让你迅速上手。.................................
安卓开发,利用SQLite实现登陆注册功能
相比大多数数据库而言,具有等优势,广泛应用于、等领域。
有时候,一个项目只有一个数据库,比如只有SQLite,或者MySQL数据库,那么我们只需要使用一个固定的数据库即可。但是一个项目如果写好了,有多个用户使用,但是多个用户使用不同的数据库,这个时候,我们就需要把软件设计成可以连接多个数据库的模式,用什么数据库,就配置什么数据库即可。4.Users实体类,这个实体类要和数据库一样的,形成一一对应的关系。11.Sqlite数据库,需要在代码里面创建数据库,建立表,再建立数据。8.我们开启MySQL数据库,然后进行调试,看程序的结果。2.安装SqlSugar。
基于Android的背单词软件,功能强大完整。
SQLite,是一款轻型的数据库,是遵守ACID的关系型数据库管理系统。说白了就是使用起来轻便简单,
Android的简单购物车案例
SQLite,是一款轻型的数据库,是遵守ACID的关系型数据库管理系统,它包含在一个相对小的C库中。它是D.RichardHipp建立的公有领域项目。它的设计目标是嵌入式的,而且已经在很多嵌入式产品中使用了它,它占用资源非常的低,在嵌入式设备中,可能只需要几百K的内存就够了。它能够支持Windows/Linux/Unix等等主流的操作系统,同时能够跟很多程序语言相结合,比如 Tcl、C#、PHP、Java等,还有ODBC接口,同样比起Mysql、PostgreSQL这两款开源的世界著名数据库...
Qt设计较为美观好看的登录注册界面(包含SQLite数据库以及TCP通信的应用)
SQLite是用C语言开发的跨平台小型数据库,可嵌入其他开发语言,也可在单机执行。SPL是用Java开发的跨平台的数据计算语言,可嵌入Java,可在单机执行,可以数据计算服务的形式被远程调用。两者的代码都是解释执行的。...
新建库.openDATA_BASE;新建表createtableLIST_NAME(DATA);语法:NAME关键字...<用逗号分割>删除表droptableNAME;查看表.schema查看表信息新建数据insertintoLIST_NAMEvalues();语法:CLASS,PARAMETER...,CLASS是类别,PARAMETER是参数<用逗号分割新建的
importsqlite3classDemo01:def__init__(self):self.conn=sqlite3.connect("sql_demo_001.db")self.cursor1=self.conn.cursor()self.cursor1.execute("select*fromtable_001wherename=?andid=?",('ssss&#0
 在客户端配置文件<configuration>节点下,添加:<connectionStrings>      <add name="localdb" connectionString="Data Source=config/local.db;Version=3;UseUTF16Encoding=True;" providerName="System.Data.SQLite.SQLiteFactory"/&g
提到锁就不得不说到死锁的问题,而SQLite也可能出现死锁。下面举个例子:连接1:BEGIN(UNLOCKED)连接1:SELECT...(SHARED)连接1:INSERT...(RESERVED)连接2:BEGIN(UNLOCKED)连接2:SELECT...(SHARED)连接1:COMMIT(PENDING,尝试获取EXCLUSIVE锁,但还有SHARED锁未释放,返回SQLITE_BUSY)连接2:INSERT...
SQLite是一种嵌入式数据库,它的数据库就是一个文件。由于SQLite本身是C写的,而且体积很小,所以,经常被集成到各种应用程序中,甚至在iOS和Android的App中都可以集成。Python就内置了SQLite3,所以,在Python中使用SQLite,不需要安装任何东西,直接使用。在使用SQLite前,我们先要搞清楚几个概念:表
设计思想————首先要确定有几个页面、和每个页面的大致布局由于是入门,我也是学习了不是很长的时间,所以项目比较low。。。。第一个页面,也就是打开APP的首页面:今天这个博客,先实现添加功能!:首先对主界面进行布局:其中activity_main.xml的代码为<?xmlversion="1.0"encoding="