>>827
pdf化はどうやって?
【文字認識】OCRソフト(3文字目)【 自炊 】
レス数が900を超えています。1000を超えると表示できなくなるよ。
2026/04/21(火) 00:02:11.99ID:GaUBEntQ0
2026/04/21(火) 08:34:57.24ID:WyQp2wYZ0
>>830
823-826-829さんのツールを使うのであれば
bunkoOCRは品質のよい画像で使って、サイズを落とした画像に変換をしておいて、
ツールでそれを指定してpdfを作るだけです
pdfはページごとになるけど結合ツールは色々あるでしょう
823-826-829さんのツールを使うのであれば
bunkoOCRは品質のよい画像で使って、サイズを落とした画像に変換をしておいて、
ツールでそれを指定してpdfを作るだけです
pdfはページごとになるけど結合ツールは色々あるでしょう
2026/04/21(火) 09:15:34.15ID:6UofQAeG0
2026/04/21(火) 10:02:33.07ID:WyQp2wYZ0
>>829
画像→PDFのオーバーヘッドが819よりも少し大きいので10個まとめてpdfを作ったらどうか試そうとしていたら
途中でエラーが発生しました
指定画像はpngでもjbig2でも発生
https://74.gigafile.nu/0730-b986119e63a9000debde011fa8daf0c4f
画像→PDFのオーバーヘッドが819よりも少し大きいので10個まとめてpdfを作ったらどうか試そうとしていたら
途中でエラーが発生しました
指定画像はpngでもjbig2でも発生
https://74.gigafile.nu/0730-b986119e63a9000debde011fa8daf0c4f
2026/04/21(火) 10:16:47.33ID:WyQp2wYZ0
>>832
近くKindle for PCは使えなくされてDRM解除はできなくなりそうです
新リーダーでスクショがブロックされたらアウトですがスクショが取れればUWSCのスクリプトとかで
まとめてスクショを取って変換するつもりです
近くKindle for PCは使えなくされてDRM解除はできなくなりそうです
新リーダーでスクショがブロックされたらアウトですがスクショが取れればUWSCのスクリプトとかで
まとめてスクショを取って変換するつもりです
835833
2026/04/21(火) 10:59:42.93ID:WyQp2wYZ0 エラーにならなかった9個を1つのPDFにまとめてみました
jbig2のサイズ合計86.5KB
819のpdf 129KB
829のpdf 185KB
今までepubで保存できていたのができなくなるので代替としてできるだけ小さく
保存しておきたいという特殊用途には向かないようでした
jbig2のサイズ合計86.5KB
819のpdf 129KB
829のpdf 185KB
今までepubで保存できていたのができなくなるので代替としてできるだけ小さく
保存しておきたいという特殊用途には向かないようでした
2026/04/21(火) 11:50:03.10ID:WEoRxsCr0
2026/04/22(水) 01:00:25.01ID:MZ83qPGU0
ndlocrlite改善きたー
もう精度あのまんまかと思ってたわ
もう精度あのまんまかと思ってたわ
838名無しさん@お腹いっぱい。
2026/04/22(水) 01:44:42.91ID:GdakDMll0 おお。モデルの修正入ってるやん
試そう
試そう
2026/04/22(水) 11:27:12.10ID:dsfTz/Us0
縦中横検出ができるようになったのか
2026/04/22(水) 14:37:47.41ID:llCGQj5X0
振り仮名は付けてくれるの?
2026/04/22(水) 14:48:36.01ID:dsfTz/Us0
ndlocrliteのjsonは縦書き横書きどちらのテキストにも
"isVertical": "true"
と書かれているのはどうしてなのかな
"isVertical": "true"
と書かれているのはどうしてなのかな
2026/04/23(木) 22:42:00.09ID:DIU9BuVo0
縦中横直ってないじゃん
https://www.toyobijutsu-prt.co.jp/com-design/dtp-63/
の例をためしたけど一番最初の
最初の「帝国の支配は52年続いた。」からデタラメ。
https://www.toyobijutsu-prt.co.jp/com-design/dtp-63/
の例をためしたけど一番最初の
最初の「帝国の支配は52年続いた。」からデタラメ。
2026/04/23(木) 22:47:59.62ID:2E75QEEx0
2026/04/24(金) 00:07:14.56ID:vqm7uVxH0
>>842
--enable-tcy --tcy-min-line-width 25 --tcy-seg-min-gap 3 --tcy-max-aspect-ratio 0.82 --tcy-ocr-margin-ratio 0.2
数字・位取り・小数点について
・連数字、適用する数字の桁数
(例)
(1)帝国の支配は、52年続いた。
(2) 気温が氷点下になったのは112年ぶりのこと。
(3) 気温が氷点下になったのは112年ぶりのこと。
・漢数字とアラビア数字の統一 (西暦など)
(例)
(4)二〇一一年九月から続いた●●内閣は五ヶ月あまりで
終了し、 2012年1月に××内閣が誕生した。
数字4桁以上の時の位取り
(例)
(5)静岡県浜松市の面積は約一五五八kmiである。
(6) 静岡県浜松市の面積は約一、五五八kmiである。
(7) 静岡県浜松市の面積は約一.五五八kmiである。
・小数点
(例)
(8)濃度0・5%の食塩水
(9)濃度0.5%の食塩水
(1)濃度0.5%の食塩水
--enable-tcy --tcy-min-line-width 25 --tcy-seg-min-gap 3 --tcy-max-aspect-ratio 0.82 --tcy-ocr-margin-ratio 0.2
数字・位取り・小数点について
・連数字、適用する数字の桁数
(例)
(1)帝国の支配は、52年続いた。
(2) 気温が氷点下になったのは112年ぶりのこと。
(3) 気温が氷点下になったのは112年ぶりのこと。
・漢数字とアラビア数字の統一 (西暦など)
(例)
(4)二〇一一年九月から続いた●●内閣は五ヶ月あまりで
終了し、 2012年1月に××内閣が誕生した。
数字4桁以上の時の位取り
(例)
(5)静岡県浜松市の面積は約一五五八kmiである。
(6) 静岡県浜松市の面積は約一、五五八kmiである。
(7) 静岡県浜松市の面積は約一.五五八kmiである。
・小数点
(例)
(8)濃度0・5%の食塩水
(9)濃度0.5%の食塩水
(1)濃度0.5%の食塩水
845名無しさん@お腹いっぱい。
2026/04/24(金) 04:29:14.75ID:Rtjh03dh0 流石に㎢は2がちっちゃすぎて出ないか
2026/04/24(金) 09:55:54.19ID:XIgeEDes0
コマンドラインで指定する必要があるのね
2桁の数字くらいGUI版デフォルトで対応してほしいな
2桁の数字くらいGUI版デフォルトで対応してほしいな
2026/04/24(金) 09:58:37.62ID:B2jNbBOS0
Win+Shift+Tの画面OCRは自動で縦中横認識出来る
2026/04/28(火) 12:27:01.92ID:Xjje+GWF0
というか横しか対応してないオチとか
2026/04/30(木) 11:59:11.44ID:oA/GtW7W0
bunkoOCRはテキストの行が入れ替わるだけでなく、テキストのブロックが丸々抜けてしまうことがあり、
そういう時にはjsonにもそのテキストのブロックは記録されていない
それでも文字は全部精度よく記録されているのでjsonでPDFも作っておくのがよさそう
そういう時にはjsonにもそのテキストのブロックは記録されていない
それでも文字は全部精度よく記録されているのでjsonでPDFも作っておくのがよさそう
850名無しさん@お腹いっぱい。
2026/04/30(木) 12:17:40.74ID:SNaEtCHY0 >>849
あれやこれや処理してる時にバグが取れてなくて飛ぶことがあるので、失敗する画像例を作者に送りつけてくれると
バグの発見が速くなるのでもしよければ送っておいてください。
だいぶ直したけど、まだリリースできてなくてすみません
あれやこれや処理してる時にバグが取れてなくて飛ぶことがあるので、失敗する画像例を作者に送りつけてくれると
バグの発見が速くなるのでもしよければ送っておいてください。
だいぶ直したけど、まだリリースできてなくてすみません
2026/04/30(木) 17:41:58.41ID:oA/GtW7W0
>>850
作者様に以前メールでお送りしたブロック順がメチャクチャになり横を縦と認識された部分もあるサンプル
https://i.imgur.com/rr8qttx.jpeg
でPDFを作ってみました
「テキストのブロックが丸々抜けてしまう」は見間違いでした すみません
SumatraPDFはページまたぎ検索もできてでPDFでもリフローテキストと同様に使えますがこの例では
bunkoOCRでの誤認識と同じく「竹藁」と「原料となっている。竹紙は」がヒットしてしまいました
「竹」と「藁」がつながってしまうのは理解できますが、「原料となっている。」と「竹紙は」が
つながってしまうのはちょっと不思議です
作者様に以前メールでお送りしたブロック順がメチャクチャになり横を縦と認識された部分もあるサンプル
https://i.imgur.com/rr8qttx.jpeg
でPDFを作ってみました
「テキストのブロックが丸々抜けてしまう」は見間違いでした すみません
SumatraPDFはページまたぎ検索もできてでPDFでもリフローテキストと同様に使えますがこの例では
bunkoOCRでの誤認識と同じく「竹藁」と「原料となっている。竹紙は」がヒットしてしまいました
「竹」と「藁」がつながってしまうのは理解できますが、「原料となっている。」と「竹紙は」が
つながってしまうのはちょっと不思議です
2026/04/30(木) 18:06:54.07ID:oA/GtW7W0
透明テキストを可視化したものを一応アップします
https://3.gigafile.nu/0808-cf784ae298abe230af3d5df929a4f435c
https://3.gigafile.nu/0808-cf784ae298abe230af3d5df929a4f435c
853名無しさん@お腹いっぱい。
2026/04/30(木) 19:27:32.05ID:SNaEtCHY0 >>851
あれかー。めちゃ難易度高いやつで、まだ完全にはクリアできてないです。
近い所を連結するようにしてるのが悪さしてるんですよね。
表っぽい、枠線がないやつは順序が難しい
いまのところこれくらい
https://120.gigafile.nu/0505-babdafae4f15de5d1577424efe06b6342
あれかー。めちゃ難易度高いやつで、まだ完全にはクリアできてないです。
近い所を連結するようにしてるのが悪さしてるんですよね。
表っぽい、枠線がないやつは順序が難しい
いまのところこれくらい
https://120.gigafile.nu/0505-babdafae4f15de5d1577424efe06b6342
2026/04/30(木) 22:51:34.32ID:oA/GtW7W0
bunkoOCRの書き出したテキストが、
「・・・現在、日本紙幣の主原料となっているほか、ティーバッグ、掃除機の紙パック
の原料となっている。
竹紙は、中国で唐時代(7世紀)から作られ、宋時代(10世紀以降)には竹が紙
の主原料となった。・・・」
となっていますが、1文字ずつ書き込んだだけのPDFをどうテキストとしてつなげるかはリーダーの判断だと思うのですが、
OCRテキストとSumatraのどちらも「原料となっている。」と「竹紙は」がつながっていたのがどうしてかなと思いました
レイアウトを維持しようという意図のないNDLOCRはテキストの順序だけは正しいですね
文字化けもいくつかあるしbunkoOCRに期待しています
「・・・現在、日本紙幣の主原料となっているほか、ティーバッグ、掃除機の紙パック
の原料となっている。
竹紙は、中国で唐時代(7世紀)から作られ、宋時代(10世紀以降)には竹が紙
の主原料となった。・・・」
となっていますが、1文字ずつ書き込んだだけのPDFをどうテキストとしてつなげるかはリーダーの判断だと思うのですが、
OCRテキストとSumatraのどちらも「原料となっている。」と「竹紙は」がつながっていたのがどうしてかなと思いました
レイアウトを維持しようという意図のないNDLOCRはテキストの順序だけは正しいですね
文字化けもいくつかあるしbunkoOCRに期待しています
855名無しさん@お腹いっぱい。
2026/05/01(金) 01:06:36.59ID:RQBXBvV60 内部的に、「竹」と「藁」のタイトルの後の空白が、段落の区切れと誤認していて
「竹 藁」で一つにしちゃってて、その後ろの本文が、空行区切りで連続している本文とみなして
繋げて出力してしまっています。
https://i.imgur.com/EnzPhEQ.png
これを解決するには、表のヘッダーと本文の部分に分けて認識できる構文解析が必要なので
結構難しい
「竹 藁」で一つにしちゃってて、その後ろの本文が、空行区切りで連続している本文とみなして
繋げて出力してしまっています。
https://i.imgur.com/EnzPhEQ.png
これを解決するには、表のヘッダーと本文の部分に分けて認識できる構文解析が必要なので
結構難しい
2026/05/01(金) 04:38:23.22ID:4dgFFWM80
普段ほとんど見ないようなレアな漢字や段組みまでケアした完璧なものよりも
普通の文庫やハードカバーのOCRなら問題なく出来る程度のバージョンでもいいので出してほしいです
普通の文庫やハードカバーのOCRなら問題なく出来る程度のバージョンでもいいので出してほしいです
2026/05/01(金) 06:09:03.28ID:Paf9p86Q0
それな
いいとこ取りしてndlocrliteにレイアウトまかせて、文字認識はbunkoocrとか出来ない?のが残念
いいとこ取りしてndlocrliteにレイアウトまかせて、文字認識はbunkoocrとか出来ない?のが残念
858名無しさん@お腹いっぱい。
2026/05/01(金) 09:43:33.87ID:RQBXBvV60 普通の文庫というか、私が今読んでる文庫本の小説を読みながら、ミスってるところを修正してるので
読書の時間が律速過程になっているという。
自分で読む本くらいちゃんとスキャンできないと意味がないのでな
ndlocrliteのやってるPARSeqと、bunkoOCRで使ってるfindtextCenterNetは、文字のデコードの仕方が異なるので
なかなか合わせにくい
PARSeqの方式は、先に文字列のあるBoxを見つけておいて、短冊状の文字列の画像をテキストにするやり方。
findtextCenterNetの方式は、文字の座標とその連結方向を見つけておいて、文字を順番に連結してテキストにするやり方。
PARSeqはTransformer系なので、文字を落としたりする。
findtextCenterNetは文字ごとにデコードするので、あとから文脈で補正できるようにTransformerで修正してる。
読書の時間が律速過程になっているという。
自分で読む本くらいちゃんとスキャンできないと意味がないのでな
ndlocrliteのやってるPARSeqと、bunkoOCRで使ってるfindtextCenterNetは、文字のデコードの仕方が異なるので
なかなか合わせにくい
PARSeqの方式は、先に文字列のあるBoxを見つけておいて、短冊状の文字列の画像をテキストにするやり方。
findtextCenterNetの方式は、文字の座標とその連結方向を見つけておいて、文字を順番に連結してテキストにするやり方。
PARSeqはTransformer系なので、文字を落としたりする。
findtextCenterNetは文字ごとにデコードするので、あとから文脈で補正できるようにTransformerで修正してる。
2026/05/01(金) 20:27:42.78ID:5O1n87Gj0
bunkoOCR作者に画像送るURLがサーバーエラーになってない?
860名無しさん@お腹いっぱい。
2026/05/01(金) 20:50:14.32ID:RQBXBvV60 >>859
ほんまや。直しておきます
ほんまや。直しておきます
861名無しさん@お腹いっぱい。
2026/05/01(金) 21:11:16.37ID:RQBXBvV60 動くようになったです。だいぶ止まってたっぽ
2026/05/01(金) 21:34:02.95ID:5O1n87Gj0
対応ありがとうございます
漢字の一が認識されないのがちょいちょいあったので送っときました
漢字の一が認識されないのがちょいちょいあったので送っときました
863名無しさん@お腹いっぱい。
2026/05/01(金) 21:40:33.64ID:RQBXBvV602026/05/01(金) 21:51:46.87ID:K98nN0p10
漢数字の「一」と同様にカタカナの「ー」も欠落することがありますね
2026/05/01(金) 21:53:35.94ID:BDPCeRc20
横だけどテスト画像提供者が作者最新版でのテスト結果を受け取れるように
画像のハッシュ値か何かをキーとしてダウンロード出来る仕組みがあったら良いのに
と思いました。
画像のハッシュ値か何かをキーとしてダウンロード出来る仕組みがあったら良いのに
と思いました。
866名無しさん@お腹いっぱい。
2026/05/02(土) 12:00:33.04ID:A2FGbi8r0 確かに。こっちから結果送りたい時に困ってたんですよね。
仕組み考えておきます。
仕組み考えておきます。
2026/05/03(日) 13:10:57.10ID:dpfsbASQ0
gemma4試したけどマルチモーダルのLLMがOCRで座標返すのが意味わからなすぎる
E4Bはスマホで動かしたけど一つ上をパソコンで動かしかったが30GBとかとびすぎやろ
E4Bはスマホで動かしたけど一つ上をパソコンで動かしかったが30GBとかとびすぎやろ
2026/05/15(金) 11:09:25.59ID:uxVN+/B90
NDLOCR-Liteが作成するpdfはUniJIS-UCS2を使っているので認識できる文字範囲は
それ以下だと想像しますがbunkoOCRの認識文字範囲はどれくらいなんでしょうか
それ以下だと想像しますがbunkoOCRの認識文字範囲はどれくらいなんでしょうか
869名無しさん@お腹いっぱい。
2026/05/15(金) 18:04:20.60ID:sJn+LSnP0 >>868
学習自体は、Unicodeコードポイントが単独で振られている漢字は対応できるようにしたはず。(異体字フラグは未対応)なので、学習に使ったフォントに、文字が収録されてたら反応すると思います。
しかし、ちょっとバグがあって、transformerで文脈補正すると新字体になってしまう文字があるので、今直してます。今のところこの部分をオフにしたら多分出そう。
学習自体は、Unicodeコードポイントが単独で振られている漢字は対応できるようにしたはず。(異体字フラグは未対応)なので、学習に使ったフォントに、文字が収録されてたら反応すると思います。
しかし、ちょっとバグがあって、transformerで文脈補正すると新字体になってしまう文字があるので、今直してます。今のところこの部分をオフにしたら多分出そう。
870名無しさん@お腹いっぱい。
2026/05/15(金) 19:42:48.80ID:iF+n6JkY0 NDLOCR試してみたけどDocument intelligenceよりは落ちるね。取り敢えずonnx直接叩いて出力まで行けたけど
レイアウト解析はLayoutモデルより使いかって良さそう
Bunko OCRはキャラクターの中心検出だっけ?Document intelligenceでキャラ単位配置までできたけど元々のポリゴンが若干ずれてるみたいなんよね
Macで使う場合モデルとengineのc++ソースだけあればいいんかな?
レイアウト解析はLayoutモデルより使いかって良さそう
Bunko OCRはキャラクターの中心検出だっけ?Document intelligenceでキャラ単位配置までできたけど元々のポリゴンが若干ずれてるみたいなんよね
Macで使う場合モデルとengineのc++ソースだけあればいいんかな?
871名無しさん@お腹いっぱい。
2026/05/15(金) 20:13:44.60ID:xfSS0l590 あ、findtextcenternetの方見ればいいのか
上に書いてあった
上に書いてあった
2026/05/15(金) 21:14:34.09ID:uxVN+/B90
https://kanji.jitenon.jp/cat/jisdai3 のJIS第3水準一番上の表をbunkoOCRで試してみましたが完璧ですね
NDOCR-Liteは古い本のために作ったはずなのに誤認識も多いし期待外れ
NDOCR-Liteは古い本のために作ったはずなのに誤認識も多いし期待外れ
2026/05/15(金) 21:56:20.94ID:FCGZ18Ho0
NDLOCR-Liteはここに列挙されている7千文字余り以外は出力されない(認識しない)のでは?
https://github.com/ndl-lab/ndlocr-lite/blob/master/train/parseqcode/configs/NDLmoji.yaml
https://github.com/ndl-lab/ndlocr-lite/blob/master/train/parseqcode/configs/NDLmoji.yaml
874名無しさん@お腹いっぱい。
2026/05/16(土) 11:58:38.21ID:qeWQmLQu0 textcenternet、macで使ってみてるけどなんかメチャクチャ時間かかってる
図表付きレイアウト600dpi高解像度だと対応してなかったりします?
単に自分の実装が悪いだけだと思うけど、どのくらいの速度が普通なんだろう
図表付きレイアウト600dpi高解像度だと対応してなかったりします?
単に自分の実装が悪いだけだと思うけど、どのくらいの速度が普通なんだろう
875名無しさん@お腹いっぱい。
2026/05/16(土) 21:45:12.49ID:TgRbPeEj0 >>874
Macでやるなら、coreMLに変換してあげて。macのMPSはそんなに速くない
Macでやるなら、coreMLに変換してあげて。macのMPSはそんなに速くない
876名無しさん@お腹いっぱい。
2026/05/17(日) 17:06:13.04ID:4yIaDp5X0877名無しさん@お腹いっぱい。
2026/06/02(火) 10:25:05.25ID:97LXg5/h0 NDL OCRなんか&がエスケープなのか&って取得されるな...
あと全角アルファベットが半角にされる
bunko ocrは少し全角で拾ってくれるけど、それでも半角が多い印象
配置するときにズレる原因になるんだよな
座標から推測してもいいけど自動認識できるモデルないかな
とくにndlはline座標だから
あと全角アルファベットが半角にされる
bunko ocrは少し全角で拾ってくれるけど、それでも半角が多い印象
配置するときにズレる原因になるんだよな
座標から推測してもいいけど自動認識できるモデルないかな
とくにndlはline座標だから
878名無しさん@お腹いっぱい。
2026/06/02(火) 10:25:26.15ID:97LXg5/h0 エスケープは&だったわ
879名無しさん@お腹いっぱい。
2026/06/02(火) 10:25:54.50ID:97LXg5/h0 あれここでもされるんか
& ampてなる
& ampてなる
880名無しさん@お腹いっぱい。
2026/06/02(火) 10:53:29.82ID:97LXg5/h0 xmlの仕様だったみたいだわ
パーサー通したら元に戻るから問題無かった
全角半角問題はまだあるけど
パーサー通したら元に戻るから問題無かった
全角半角問題はまだあるけど
881名無しさん@お腹いっぱい。
2026/06/02(火) 14:37:08.93ID:uBCAbqZ40 全角半角は本質的に形が一緒なので、判定はむずい
補正判定するとしたら、文字の幅が全角なのを使うか、文字送りが全角幅なのを使うか
補正判定するとしたら、文字の幅が全角なのを使うか、文字送りが全角幅なのを使うか
882名無しさん@お腹いっぱい。
2026/06/02(火) 14:53:28.06ID:haE6UAe70 全角文字が複数あればともかく
Mとかは全角でもプロポーショナルでも横幅が同じようなものなので1文字だと人間でもAIでも厳密な区別は不可能
前後の文脈とか縦書きか横書きかとか他の場所でどう現れてるかとかフォントの癖とか、より上位のコンテキストから判断する必要がある
全角と半角は使用フォントの違いであってテキストの違いではないと捉えるべき
Mとかは全角でもプロポーショナルでも横幅が同じようなものなので1文字だと人間でもAIでも厳密な区別は不可能
前後の文脈とか縦書きか横書きかとか他の場所でどう現れてるかとかフォントの癖とか、より上位のコンテキストから判断する必要がある
全角と半角は使用フォントの違いであってテキストの違いではないと捉えるべき
883名無しさん@お腹いっぱい。
2026/06/02(火) 18:39:34.20ID:QccPy7qd0 まぁ、その通りでテキスト抽出するだけなrら問題にならないんだが、PDFに戻すと結構ずれて気になることがあるんだよね
コンテキスト判断必要なところからしてAI向けだとは思う
コンテキスト判断必要なところからしてAI向けだとは思う
884名無しさん@お腹いっぱい。
2026/06/02(火) 20:21:33.85ID:haE6UAe70 >>883
それをきちんとやろうとしたら全角半角以外でもフォントのサイズやイタリックやボールドなど他の字形要素でも同じ問題が起きるので
「OCRでテキストだけじゃなく各文字の使用フォントとサイズまで識別する。透明テキストを埋め込む際に同じフォントとサイズで埋め込む」までやらないといけない
フォント識別してもそのフォント持ってない問題とかもあって、裏技としてはOCRしながら画像から新しくフォントを生成してそのフォントで埋め込むみたいなのもできるんだろうけど普通はコストに見合わない
それをきちんとやろうとしたら全角半角以外でもフォントのサイズやイタリックやボールドなど他の字形要素でも同じ問題が起きるので
「OCRでテキストだけじゃなく各文字の使用フォントとサイズまで識別する。透明テキストを埋め込む際に同じフォントとサイズで埋め込む」までやらないといけない
フォント識別してもそのフォント持ってない問題とかもあって、裏技としてはOCRしながら画像から新しくフォントを生成してそのフォントで埋め込むみたいなのもできるんだろうけど普通はコストに見合わない
2026/06/02(火) 20:31:29.21ID:64umnu5E0
英文専用OCRではイタリックやボールド、飾り文字も認識出来るのがあったかと
886名無しさん@お腹いっぱい。
2026/06/03(水) 09:16:04.40ID:/Nv6QzpK0 >>884
Document intelligence ではフォントとスタイル認識できるからやってみてるけど、あっちはあっちでポリゴンが実際の文字の位置とちょっとずれてるっぽくて面倒くさいのよね
Document intelligence ではフォントとスタイル認識できるからやってみてるけど、あっちはあっちでポリゴンが実際の文字の位置とちょっとずれてるっぽくて面倒くさいのよね
887名無しさん@お腹いっぱい。
2026/06/03(水) 10:16:52.63ID:FUE8x4HF0 NDLOCR-Lite v.1.2.1 で本に載っているC言語系のソースコードを OCR でテキストファイルに出すと関数の終わりのカッコ } で謎の数字が入っている。
記号やプログラムで使われる特定のキーワードだと、プログラム的に解釈して、その時持っている変数をOCRの結果に出してそう。
変換精度は満足。
1と小文字Lを間違えるのと、スペース区切りを間違えるのは仕方がない。
記号やプログラムで使われる特定のキーワードだと、プログラム的に解釈して、その時持っている変数をOCRの結果に出してそう。
変換精度は満足。
1と小文字Lを間違えるのと、スペース区切りを間違えるのは仕方がない。
888名無しさん@お腹いっぱい。
2026/06/04(木) 00:05:48.27ID:rR1rcJJ70 中国語日本語の専門用語辞典をNDLにかけてみたら時々謎の英語ぽい無意味なアルファベット文字列が出力されてた
2026/06/06(土) 22:42:05.88ID:yoBQqSOK0
ndlocr-liteにプレビューとして1.2.2が出ていた
PDFの透明テキストの位置が改善されていた
PDFの画像は今まで可逆のFlateエンコードだったのが品質75のDCTエンコードに変えられた
初期版の時のようにASCIIのPDFになってしまったのでcpdf -squeezeとかしないとサイズがでかい
PDFの透明テキストの位置が改善されていた
PDFの画像は今まで可逆のFlateエンコードだったのが品質75のDCTエンコードに変えられた
初期版の時のようにASCIIのPDFになってしまったのでcpdf -squeezeとかしないとサイズがでかい
2026/06/07(日) 14:00:09.86ID:RxhR464W0
2026/06/24(水) 20:27:39.88ID:sYZuehuq0
NDLOCR-Liteを使おうと思ったら起動してすぐ落ちるんですが
必要スペックってどれくらいですか?
必要スペックってどれくらいですか?
892名無しさん@お腹いっぱい。
2026/06/25(木) 13:17:16.23ID:Td1e6OTl0 Macでも余裕なので本当にスペック不足ならすぐに捨てて買い換えるべき
893名無しさん@お腹いっぱい。
2026/06/25(木) 14:38:24.14ID:E7sAMfse0 読み込むファイルの解像度が高すぎるんじゃないの
2026/06/26(金) 07:48:28.41ID:XhhUmr6/0
Windows11じゃない起動できないんですかね
895名無しさん@お腹いっぱい。
2026/06/26(金) 19:31:51.09ID:x0rt6wrK0 んなこたあねぇだろ
Linuxでしか使ってないから知らんけど
Sandy Bridge世代の産廃でも余裕で動く
流石にメモリは12Gあるが
メモリ少なすぎるんちゃう?
Linuxでしか使ってないから知らんけど
Sandy Bridge世代の産廃でも余裕で動く
流石にメモリは12Gあるが
メモリ少なすぎるんちゃう?
2026/06/26(金) 19:59:41.70ID:XhhUmr6/0
自分もSandy Bridgeでメモリは16GBです
AIにはスペックかWIN10だからと言われましたがどうやら違うんですね
AIにはスペックかWIN10だからと言われましたがどうやら違うんですね
2026/06/26(金) 20:35:31.28ID:XhhUmr6/0
ググってみたらフォルダの場所でエラーがおきるみたいで
試しにCドライブ直下にフォルダを展開したら起動できました
試しにCドライブ直下にフォルダを展開したら起動できました
898名無しさん@お腹いっぱい。
2026/07/02(木) 20:11:24.91ID:ETa5le330 Rust_DN_SuperBook_PDF_Converter の環境構築をもう一度頑張ってみたい。
俺の環境はWindows11
情報系学部2年生レベル向けの解説を希望。
環境構築の完全解決につながる回答には仮想通貨で200円分払ってもいいです。
俺の環境はWindows11
情報系学部2年生レベル向けの解説を希望。
環境構築の完全解決につながる回答には仮想通貨で200円分払ってもいいです。
899名無しさん@お腹いっぱい。
2026/07/02(木) 20:50:36.69ID:ETa5le330 AIに聞きながらやってるんだが、何の説明もなくあれこれコマンドを実行させたり、アプリを次から次へとインストさせようとしててマジで不信感しかわかん。
2026/07/03(金) 18:03:19.53ID:f9zVjJ/00
もしかして世に言うAI格差ってやつですか
2026/07/03(金) 20:24:52.32ID:dNk8jiy60
>>898
これがAIに代替される人材w
これがAIに代替される人材w
2026/07/03(金) 20:29:52.87ID:bMazsbXR0
Windows2000版とWin98版
希望です
希望です
903名無しさん@お腹いっぱい。
2026/07/04(土) 11:52:41.41ID:FrArTNcC0 ググっても、DN_SuperBook_PDF_Converterの環境構築のブログはヒットしても、Rust_DN_SuperBook_PDF_Converterの環境構築についてはヒットしない
マジで誰か初心者向けの解説記事書いてくれ。数百円程度なら課金するから
マジで誰か初心者向けの解説記事書いてくれ。数百円程度なら課金するから
904名無しさん@お腹いっぱい。
2026/07/04(土) 20:41:27.90ID:gbsX50I70 OCRのソフトって、いくらで売るべきなのかね?
2026/08/20(木) 22:24:42.94ID:LoiIkPZ60
bunkoOCRそろそろ更新してくれー
2026/08/20(木) 22:48:35.04ID:fBgjd1QU0
個人開発のbunkoOCRは期待できないので親方日の丸のNDLOCR-Liteをメインに使うことにした
OCRなんて所詮精度は五十歩百歩
OCRなんて所詮精度は五十歩百歩
2026/08/21(金) 13:54:10.96ID:dI2d0Fxn0
最近YomiTokuを併用してる
2026/08/24(月) 07:53:52.41ID:0mSdp9nu0
NDLOCRは振り仮名つけるオプションがあるみたいだけどliteはないのかな?
それさえ出来れば完全に乗り換えられる
それさえ出来れば完全に乗り換えられる
2026/08/24(月) 08:58:26.73ID:tHoozlv90
うちはCPUなのでliteしか使えないがまあまあの精度で速いのでそれでいい
多少まちがっていてもいいように、また、どんなレイアウトでもいいように
PDFにして使っている
PDFだと振り仮名は不要だし検索ではかえって邪魔
多少まちがっていてもいいように、また、どんなレイアウトでもいいように
PDFにして使っている
PDFだと振り仮名は不要だし検索ではかえって邪魔
2026/08/27(木) 08:19:14.19ID:Ldz5+PB70
低スペPCは切り捨ててgpuフル活用してほしい
2026/09/01(火) 15:44:58.38ID:Goh+Zee00
昔の雑誌のプログラムリストをOCRするには何を使うのがいい?
スラッシュ付きのゼロが使われている
スラッシュ付きのゼロが使われている
2026/09/01(火) 16:14:34.14ID:eS7y0h240
>>911
プログラムリスト部分だけでいいなら日本語関係ないからClaudeやChatGPTにOCRやらせてみたらどうかな
プログラムリスト部分だけでいいなら日本語関係ないからClaudeやChatGPTにOCRやらせてみたらどうかな
2026/09/01(火) 17:04:52.53ID:Goh+Zee00
なるほど そういう手があったんですね
2026/09/05(土) 23:00:55.25ID:fjHP8GDK0
ndlocr-liteのv1.3.0-previewでpdf出力がベータ版ではなくなって
透明テキストの位置が少し改善された
透明テキストの位置が少し改善された
2026/09/20(日) 10:41:37.24ID:J5S8uxb70
目視じゃないと判断できない文字結構あるね
「○(まる)」と「〇(漢数字ゼロ)」
ひらがな、カタカナの「へ」と「ペ」
「口(くち)」とカタカナの「ロ」
など
「○(まる)」と「〇(漢数字ゼロ)」
ひらがな、カタカナの「へ」と「ペ」
「口(くち)」とカタカナの「ロ」
など
2026/09/20(日) 14:40:57.97ID:Rk6Qu4ZN0
これはよくあるな
二一(漢数字)がニー(カタカナ)になってた時は笑ってしまった
OCR結果を別AIで文脈を元に検証させたら良さそう
二一(漢数字)がニー(カタカナ)になってた時は笑ってしまった
OCR結果を別AIで文脈を元に検証させたら良さそう
918名無しさん@お腹いっぱい。
2026/09/21(月) 11:17:41.29ID:SH+JdUYi0 フリーの日本語OCRはNDLOCR-Lite・YomiToku・PP-OCR V6・bunkoOCRあたりが有力?
これらに対応したWindows・iOS・Androidアプリが出たらすごく捗りそう
これらに対応したWindows・iOS・Androidアプリが出たらすごく捗りそう
919名無しさん@お腹いっぱい。
2026/09/21(月) 20:59:56.70ID:ofLJzsfd0 OCRの結果を多数決させる方式を、論文で提唱してる人がいた
有名なやつで演算してから結果投票して、よさげな部分だけいいとこ取りしたら完璧になりそう
有名なやつで演算してから結果投票して、よさげな部分だけいいとこ取りしたら完璧になりそう
レスを投稿する
レス数が900を超えています。1000を超えると表示できなくなるよ。
ニュース
- オープンAI、赤字 43兆6000億円 2026年から30年末まで 「死の交差」が迫る [お断り★]
- ノーベル平和賞に玉城デニー知事を推薦 立命館大の君島教授 [少考さん★]
- 台風25号で千葉のラーメン店また被災…1か月余りで3度目「再開しては被災繰り返し、心身ともに疲れた」 [背油チャッチャ★]
- 声優緒方恵美「この国は国民から考える力を奪い…」民主主義訴え 「その予算で救えるものがたくさんあるのにーなぜ #広報室予算 [少考さん★]
- トランプ米大統領、イランが合意しなければイランを「壊滅させる」 国連総会で声明 [お断り★]
- ソフトバンクG、また借金してオープンAIに1兆7050億円を投入 債券の格付けはすでにジャンク級 [お断り★]
- 【高市悲報】千葉印旛沼、江戸時代から洪水多発、水害防止事業も失敗していた [733893279]
- 三浦瑠麗「ジャニー喜多川を許すな? でも、貴方たち社会のせいで性被害に遭う人はたくさんいますよ?」 これ。 [592058334]
- 【SW暇な奴来い】あんかで指定されたものを全力で探してうpするスレ
- 【悲報】ラーメン二郎に13年勤めた女店員さん、ブチギレ発狂してしまうwwwwwwwwwwwwwwwwww [977261419]
- 【悲報】現代のガキ、終わる。 [308389511]
- 【なにここ】🏡👊😅👊🏡【スレタイすごいな‼】