Блог им. Yougin |Жэпэтэ чаты и прочие нейронки тут бессильны

Как-то я планировал сделать алгоритм, который парсил бы отчеты с сайтов организаций (рассматривал ЦРКИ). Забирал отчеты, переводил бы сканы в символы и копировал данные в ядро, которое прогоняло бы данные через скоринговые модели и фин. коэффициенты. Планы были конские, а сама идея полыхала жаркой мотивацией до одного щепетильного момента. 

Все уперлось в криворукость бухов или тех кого они просят отсканировать документы... 

Жэпэтэ чаты и прочие нейронки тут бессильны

Вот берет нейронка скан и такая: «Видишь там 6? Нет? А я вижу!» 

И как бы ладно если в конце числа неверная циферка, например не 563 722 103, а 563 722 102. Но если она идет, например, первая, то тут уже совсем не весело. Алгоритм та будет работать, но на сколько эти данные будут «правильные», возникают вопросы. Одна искаженная циферка в начале приведет к крайне неверным решениям в конце. 

Порой открываю отчеты от разных компаний и мне прям хочется скинуть пару монет этим компаниям, чтобы они купили принтер нормальный, а не фоткали отчеты на домофон… Хотя в данном примере, компания с названием «Репчатая Нефть» видимо использовала максимальное сжатие документа, чтобы он подгрузился в ЭДО или на жесткий диск где мало места XD



( Читать дальше )

....все тэги
UPDONW
Новый дизайн