9.2.6.5. 深度学习样本库数据库设计¶
深度学习样本库数据库分为两个独立部分,一部分为自然图像与遥感影像的数据库,另一部分为OCR的数据库。、 # 自然图像与遥感影像的数据库 遥感影像、矢量数据由数据中心进行管理,通过计算中心生成样本,生成样本时不进行数据增强操作,数据增强由训练的时候实时增强(或训练前批处理生成到临时文件夹中)。 ## 标签表(labels): 记录已配置的标签信息。一张图片可赋予不同标签,作为不同训练任务的样本使用。
是否主键 | 字段名 | 字段描述 | 数据类型 | 可空 | 注释 |
:——: | :——–: | :———————————–: | :——: | :—: | :———————————-: |
是 | id | 标签id | Integer | 否 | 自增 |
  | label_name | 标签名 | String | 否 | 如“动物分类标签” |
  | categories | 标签对应的种类信息,用英文逗号“,”分隔 | String | 否 | 如“dog,cat,mouse” |
  | label_type | 标签类型 | Integer | 否 | 1:图像分类;2:目标检测;3:语义分割; |
## 样本表(samples): 图片与标签属于多对多关系,一张图片可属于不同标签,以作为不同样本参与到不同的训练任务中;一个标签也可被不同图片使用。
是否主键 | 字段名 | 字段描述 | 数据类型 | 可空 | 注释 |
:——: | :——–: | :———————-: | :——: | :—: | :—————————————————————————————————————————————————————————————————————————————————: |
是 | id | 样本id | Integer | 否 | 自增 |
  | image_path | 图片路径 | String | 否 | 样本对应图片的绝对路径,或为hdfs或服务器local路径 |
  | label_id | 标签id | Integer | 否 | 标签id,通过该字段与标签表关联 |
  | category | 样本标签对应种类的索引号 | Integer | 否 | 对应标签表categories字段相应类别的索引号。-1表示没有类别,即图片为负样本,同时value为空。可通过该字段筛选特定种类的样本。 |
  | coords | 标注的坐标信息 | String | 否 | 若标签类型为1,则为空。若标签类型为2,则存储bbox的坐标信息,顺序xmin、ymin、xmax、ymax,如:111, 111, 222, 222。若标签类型为3,则存储多边形坐标串。坐标点格式为x1,y1,x2,y2……,坐标串逆时针方向记录,首尾点坐标不重复存。如:111,111,222,222,333,333…… |
# OCR样本数据库 与影像数据库设计思路不同,OCR样本库不关注每个样本是具体是什么类型,它关注每个数据库包含哪些特点的样本集合,这样可以指导我们添加数据库的组合进行模型训练。 ## 数据库表 它记录数据库的文件路径,数据库以lmdb方式存储,每条记录对应一个样本库,并且描述样本库具有哪些特点,如文字内容,文字字体,背景图片集,字符间距等。
是否主键 | 字段名 | 字段描述 | 数据类型 | 可空 | 注释 |
:——: | :————-: | :————————: | :——: | :—: | :———————————————–: |
是 | id | 样本库id | Integer | 否 | 自增 |
  | sample_path | 样本库路径(lmdb文件)路径 | String | 否 | 样本库的绝对路径 |
  | content_path | 样本库内容的文件路径 | String | 否 | 支持txt,html,epub格式文件 |
  | generate_method | 样本库内容的生成方法 | Integer | 否 | 0:随机生成;1:顺序生成;2:人工标注 |
  | augment | 数据增强方法描述 | String | 是 | 使用数据增强的方法,方法和参数以json格式表示 |
  | background | 背景的文件夹路径 | String | 是 | 样本用哪些背景图片生成的: |
  | sample_type | 样本库的使用类型 | Integer | 否 | 0:文本识别;1:常规文本检测;2:自然场景文本检测 |
  | desc | 样本特点描述 | String | 是 | 用于描述样本集的特点或者功能,尽量以json组织 |