Скани з копірапоштоюСтарий архівминулі перекладиРозпізнаваннярядки й впевненістьПам’ять перекладівTMXЗвірка фактівімена, числа, датиЕкран вичиткидля перекладачаБланк бюроdocx і PDF
Перший результат за тиждень, у роботі через місяць
Статус
Працює, йде другий етап
Свідоцтва, дипломи й паспорти з п’яти країн приходять фотокопіями. Перекладачі передруковували їх вручну. Тепер система читає скан, підставляє те, що бюро вже перекладало, і дає перекладачу чернетку в бланку бюро.
Задача.
Кожен документ надходив сканом з офісного копіра, без текстового шару. Перекладачі передруковували документи рядок за рядком, а роки готових перекладів лежали в папках, де нічого не знайдеш.
Що ми зробили.
Сканер надсилає лист на пошту, система забирає кожен лист і відкриває під нього завдання.
Розпізнавання тексту зі збереженням позицій рядків і оцінкою впевненості для кожного слова: сумнівні рядки позначені для перекладача.
Пам’ять перекладів у галузевому форматі TMX. Усе, що вже перекладали, підставляється з неї, і лише новий текст іде в машинний переклад з глосарієм бюро.
Автоматична перевірка, що імена, числа й дати в перекладі збігаються з оригіналом.
Збирання у вордівський бланк бюро, експорт у PDF та екран вичитки. Кожен затверджений рядок повертається в пам’ять.
Інструмент, що вирівнює старий архів бюро з оригіналами, щоб наповнити пам’ять минулими роботами.
Рішення, які варто пояснити.
Хмарне розпізнавання замість десктопної ліцензії
Близько $1.5 за тисячу сторінок, без ліміту сторінок і прив’язки до комп’ютера, у регіоні ЄС, бо в документах паспортні дані.
Не навчати модель на сотні документів
На такому обсязі вивірена пам’ять надійніша за донавчання, а бюро бачить і може виправити кожну пару в ній.
Печатки та імена лишаються людині
Текст печаток не вгадується, на його місце ставиться позначка. Будь-яка зміна імені чи числа потребує підтвердження перекладача.
У цифрах.
1 537автотестів, проходять за 17 секунд
19 / 19документів усіх типів дійшли до готового файлу в регресійному прогоні