如何解决如何返回存储在HDF5文件中的字符串列表
希望有人可以对此有所启发。我正在尝试学习有关HDF5文件的方法。不知何故,这个字符串列表以整数数组的形式被编码到文件中,但是我无法弄清楚如何对其进行解码。我可以使用read_hdf函数将文件重新插入pandas中,但这不是重点-我试图理解编码逻辑。这里总结了我正在处理的示例。
smiles.txt =
structure
[11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24
[11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24
[11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)C(F)(F)F
[11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3
[11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3
>>> import pandas as pd
>>> df = pd.read_csv('smiles.txt',header=0)
>>> df.to_hdf('smiles.h5','table')
然后,我探索新创建的HDF5文件的结构:
>>> import h5py
>>> with h5py.File('smiles.h5',"r") as f:
>>> f.visit(print)
table
table/axis0
table/axis1
table/block0_items
table/block0_values
>>> with h5py.File('smiles_temp','r') as f:
>>> print(list(f.keys()))
>>> print(f['/thekey/axis0'][:])
>>> print(f['/thekey/axis1'][:])
>>> print(f['/thekey/block0_items'][:])
>>> print(f['/thekey/block0_values'][:])
['thekey']
[b'structure']
[0 1 2 3 4]
[b'structure']
[array([128,4,149,123,1,140,21,110,117,109,112,121,46,99,111,114,101,108,116,105,97,148,12,95,115,147,5,7,100,75,133,67,98,135,82,40,134,104,3,2,79,56,124,78,74,255,63,137,93,41,91,49,72,50,64,51,52,54,83,61,70,44,46],dtype=uint8)]
如何使用h5py返回字符串列表?
解决方法
请澄清一下,数据框显示为:
In [2]: df = pd.read_csv('stack63452223.csv',header=0)
In [3]: df
Out[3]:
structure
0 [11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24
1 [11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24
2 [11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)...
3 [11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3
4 [11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3
In [11]: df._values
Out[11]:
array([['[11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24'],['[11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24'],['[11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)C(F)(F)F'],['[11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3'],['[11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3']],dtype=object)
或作为字符串列表:
In [24]: df['structure'].to_list()
Out[24]:
['[11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24','[11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24','[11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)C(F)(F)F','[11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3','[11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3']
h5
由pytables
编写,与h5py
不同;通常h5py
可以读取pytables
,但是细节可能很复杂。
顶级键:
['axis0','axis1','block0_items','block0_values']
数据框具有轴(行和列)。在另一个场合,我研究了数据框如何存储其值,发现它使用blocks
,每个保存的列都有一个公共dtype。这里有1列,它是object
dtype,因为它包含字符串。
HDF5
中的字符串有点尴尬,尤其是unicode。 numpy
数组使用unicode字符串dtype; pandas
使用对象dtype,引用Python字符串(存储在数据框外部)。然后,我怀疑在保存这样的帧pytables
中使用的是更复杂的引用方案(通过h5py
并不能立即看出)。
猜想我只是不知道,这是一个很长的答案。
熊猫自己的h5负载:
In [19]: pd.read_hdf('stack63452223.h5','table')
Out[19]:
structure
0 [11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24
1 [11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24
2 [11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)...
3 [11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3
4 [11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3
h5对象还具有attrs
,
In [38]: f['table'].attrs.keys()
Out[38]: <KeysViewHDF5 ['CLASS','TITLE','VERSION','axis0_variety','axis1_variety','block0_items_variety','encoding','errors','nblocks','ndim','pandas_type','pandas_version']>
闲逛我发现:
In [66]: x=f['table']['block0_values'][0]
In [67]: b''.join(x.view('S1').tolist())
Out[67]: b'\x80\x04\x95y\x01\x8c\x15numpy.core.multiarray\x94\x8c\x0c_reconstruct\x94\x93\x94\x8c\x05numpy\x94\x8c\x07ndarray\x94\x93\x94K\x85\x94C\x01b\x94\x87\x94R\x94(K\x01K\x05K\x01\x86\x94h\x03\x8c\x05dtype\x94\x93\x94\x8c\x02O8\x94\x89\x88\x87\x94R\x94(K\x03\x8c\x01|\x94NNNJ\xff\xff\xff\xffJ\xff\xff\xff\xffK?t\x94b\x89]\x94(\x8c)[11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24\x94\x8c([11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24\x94\x8c6[11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)C(F)(F)F\x94\x8c,[11CH3]c1ccccc1O[C@H]([C@@H]2CNCCO2)c3ccccc3\x94\x8c,[11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3\x94et\x94b.'
看起来像您的琴弦在那儿。 uint8
是单字节dtype,可以将其视为字节。加入它们,我会看到您的字符串以某种方式串联在一起。
重新格式化:
Out[67]: b'\x80\x04\x95y\x01\x8c\x15numpy.core.multiarray\x94\x8c\x0c_reconstruct\x94\x93\x94\x8c\x05numpy\x94\x8c\x07ndarray\x94\x93\x94K\x85\x94C\x01b\x94\x87\x94R\x94(K\x01K\x05K\x01\x86\x94h\x03\x8c\x05dtype\x94\x93\x94\x8c\x02O8\x94\x89\x88\x87\x94R\x94(K\x03\x8c\x01|\x94NNNJ\xff\xff\xff\xffJ\xff\xff\xff\xffK?t\x94b\x89]\x94(\x8c)
[11CH2]1NCCN2C[C@@H]3CCC[C@@H]3c4cccc1c24\x94\x8c(
[11CH2]1NCCN2[C@@H]3CCC[C@@H]3c4cccc1c24\x94\x8c6
[11CH3]c1ccc(cc1)c2cc(nn2c3ccc(cc3)S(=O)(=O)N)C(F)(F)F\x94\x8c,[11CH3]c1ccccc1S[C@H]([C@@H]2CNCCO2)c3ccccc3\x94et\x94b.'
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。