使用pandas生成/读取csv文件的方法实例-巨人网络通讯

使用pandas生成/读取csv文件的方法实例

前言

csv是我接触的比较早的一种文件，比较好的是这种文件既能够以电子表格的形式查看又能够以文本的形式查看。

先引入pandas库

import pandas as pd

方法一：

1、我构造了一个cont_list，结构为列表嵌套字典，字典是每一个样本，类似于我们爬虫爬下来的数据的结构

2、利用pd.DataFrame方法先将数据转换成一个二维结构数据，如下方打印的内容所示，cloumns指定列表，列表必须是列表

3、to_csv方法可以直接保存csv文件，index=False表示csv文件不加行序号

保存csv结果

应用到我们的爬虫代码，传入的con_list就是[{},{},{}****]这样的额数据结构，encoding="utf_8_sig"，encoding="gb18030”,我这边解决中文编码问题

是不是很方便就，2行代码即可搞定保存，是不是比上次讲的方法简单好多，其实很多方法，还有python的优秀库，都使python这门语言在数据分析领域有极大的优势

方法二：

流程：模拟登录→获取Html页面→正则解析所有符合条件的行→逐一将符合条件的行的所有列存入到CSVData[]临时变量中→写入到CSV文件中

核心代码：

####写入csv文件中
 
with open(self.CsvFileName, 'wb') as csvfile:
 
spamwriter = csv.writer(csvfile, dialect='excel')
 
#设置标题
 
spamwriter.writerow(["游戏账号","用户类型","游戏名称","渠道","充值类型","充值金额","返利金额","单号","日期"])
 
#将CsvData中的数据循环写入到CsvFileName文件中
 
for item in self.CsvData:
 
spamwriter.writerow(item)

完整代码：

# coding=utf-8
 
import urllib
 
import urllib2
 
import cookielib
 
import re
 
import csv
 
import sys
 
 
class Pyw():
 
#初始化数据
 
def __init__(self):
 
#登录的Url地址
 
self.LoginUrl="http://v.pyw.cn/login/check"
 
#所要获取的Url地址
 
self.PageUrl="http://v.pyw.cn/Data/accountdetail/%s"
 
# 传输的数据：用户名、密码、是否记住用户名
 
self.PostData = urllib.urlencode({
 
"username": "15880xxxxxx",
 
"password": "a123456",
 
"remember": "1"
 
})
 
#第几笔记录
 
self.PageIndex=0;
 
#循环获取共4页内容
 
self.PageTotal=1
 
#正则解析出tr
 
self.TrExp=re.compile("(?isu)tr[^>]*>(.*?)/tr>")
 
#正则解析出td
 
self.TdExp = re.compile("(?isu)td[^>]*>(.*?)/td>")
 
#创建cookie
 
self.cookie = cookielib.CookieJar()
 
#构建opener
 
self.opener=urllib2.build_opener(urllib2.HTTPCookieProcessor(self.cookie))
 
#解析页面总页数
 
self.Total=4
 
#####设置csv文件
 
self.CsvFileName="Pyw.csv"
 
#####存储Csv数据
 
self.CsvData=[]
 
 
#解析网页中的内容
 
def GetPageItem(self,PageHtml):
 
#循环取出Table中的所有行
 
for row in self.TrExp.findall(PageHtml):
 
#取出当前行的所有列
 
coloumn=self.TdExp.findall(row)
 
#判断符合的记录
 
if len(coloumn) == 9:
 
# print "游戏账号:%s" % coloumn[0].strip()
 
# print "用户类型:%s" % coloumn[1].strip()
 
# print "游戏名称:%s" % coloumn[2].strip()
 
# print "渠道:%s" % coloumn[3].strip()
 
# print "充值类型:%s" % coloumn[4].strip()
 
# print "充值金额:%s" % coloumn[5].strip().replace("￥", "")
 
# print "返利金额:%s" % coloumn[6].strip().replace("￥", "")
 
# print "单号:%s" % coloumn[7].strip()
 
# print "日期:%s" % coloumn[8].strip()
 
#拼凑行数据
 
d=[coloumn[0].strip(),
 
coloumn[1].strip(),
 
coloumn[2].strip(),
 
coloumn[3].strip(),
 
coloumn[4].strip(),
 
coloumn[5].strip().replace("￥", ""),
 
coloumn[6].strip().replace("￥", ""),
 
coloumn[7].strip(),
 
coloumn[8].strip()]
 
self.CsvData.append(d)
 
 
#模拟登录并获取页面数据
 
def GetPageHtml(self):
 
try:
 
#模拟登录
 
request=urllib2.Request(url=self.LoginUrl,data=self.PostData)
 
ResultHtml=self.opener.open(request)
 
#开始执行获取页面数据
 
while self.PageTotal=self.Total:
 
#动态拼凑所要解析的Url
 
m_PageUrl = self.PageUrl % self.PageTotal
 
#计算当期第几页
 
self.PageTotal = self.PageTotal + 1
 
#获取当前解析页面的所有内容
 
ResultHtml=self.opener.open(m_PageUrl)
 
#解析网页中的内容
 
self.GetPageItem(ResultHtml.read())
 
 
####写入Csv文件中
 
with open(self.CsvFileName, 'wb') as csvfile:
 
spamwriter = csv.writer(csvfile, dialect='excel')
 
#设置标题
 
spamwriter.writerow(["游戏账号","用户类型","游戏名称","渠道","充值类型","充值金额","返利金额","单号","日期"])
 
#将CsvData中的数据循环写入到CsvFileName文件中
 
for item in self.CsvData:
 
spamwriter.writerow(item)
 
 
print "成功导出CSV文件！"
 
except Exception,e:
 
print "404 error!%s" % e
 
#实例化类
 
p=Pyw()
 
#执行方法
 
p.GetPageHtml()

导出结果

读取CSV

import pandas as pd

data = pd.read_table('地址', sep=",")['网址'].values

print(data[1])

总结

到此这篇关于使用pandas生成/读取csv文件的文章就介绍到这了,更多相关pandas生成读取csv文件内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

使用pandas读取csv文件的指定列方法
Python Pandas批量读取csv文件到dataframe的方法
使用实现pandas读取csv文件指定的前几行
解决pandas使用read_csv()读取文件遇到的问题
pandas读取CSV文件时查看修改各列的数据类型格式
利用Pandas读取文件路径或文件名称包含中文的csv文件方法
pandas读取csv文件,分隔符参数sep的实例
解决Python中pandas读取*.csv文件出现编码问题
python pandas读取csv后,获取列标签的方法
Pandas读写CSV文件的方法示例

上一篇：python自动化八大定位元素讲解
下一篇：python利用pandas分析学生期末成绩实例代码

使用pandas生成/读取csv文件的方法实例

前言 csv是我接触的比较早的一种文件，比较好的是这种文件既能够以电子表格的形式查看又能够以文本的形式查看。先引入pandas库 import pandas as pd 方法一： 1、我构造了一个cont_list，结使用,pandas,生成,读取,csv,...

海南电销不封卡哪家正规（海南电话是干什么的）

承德电销机器人（承德电销机器人电话）

本文目录一览： 1、如何用智能电话机器人进行电销?2、电销机器人怎么样？3、电销A...

上海不标记中间号防封线路商家,电销外呼线路办理公司

一企嗨电话营销系统 1．当前的电销场景有哪些困扰？ 1）手机.卡频繁被封，电销业务...

400电话申请展现企业好优质风貌

一个企业必须要展示出自己的能力，展示出自己在企业发展过程中对我们客户是非常关...

物联网博览会预告丨深圳网亿集团拍了拍你，并送上一份

IOTE 2020第十四届国际物联网博览会将于7月29-31日在深圳会展中心隆重举行作为物联网...

ansible批量部署tomcat的方法

1.1 构建目录结构此操作是安装nginx+mysql+tomcat+db的目录结构，可以参考一下，不错~ mk...

机器人应用

1.工作单调情绪影响大，人工无法长时间保持工作热情，遇到恶劣对话情景时容易产生...

湖州防封号电话呼叫软件哪里有,电话销售系统-本周热搜

湖州防封号电话呼叫软件哪里有,电话销售系统覆盖咨询、推荐、查询等各类任务指令场...

电话回拨外呼系统（外呼系统）

本文目录一览： 1、什么是网络电话外呼系统？2、电销企业为什么需要电话外呼系统？...

天津高频次电销卡（天津高频次电销卡怎么办理）

今日给各位共享天津高频次电销卡的常识，其间也会对天津高频次电销卡怎样处理进行...

电话销售前景如何？还能做吗？

电话营销是一个传统类型的营销渠道，最辉煌的那几年，几乎满大街都是做电销的。只...

成都移动外呼系统收费（移动外呼平台）

今日给各位共享成都移动外呼体系收费的常识，其间也会对移动外呼渠道进行解说，假...

400电话成监督服务电话

现在很多行业都有属于自己的通讯服务电话，也设立服务监督电话，不过真正发挥监督...

长沙电话机器人的公司（长沙智能机器人公司）

本篇文章给大家谈谈长沙电话机器人的公司，以及长沙智能机器人公司对应的知识点，...

电销卡的常规使用技巧

电销卡的常规使用技巧相信大家都知道,电销卡具有一个吸人眼球的特点,那就是稳定防...

使用pandas生成/读取csv文件的方法实例

全 部 栏 目

前言

方法一：

方法二：

读取CSV

总结

全部栏目