顯示具有 好用軟體及技巧 標籤的文章。 顯示所有文章
顯示具有 好用軟體及技巧 標籤的文章。 顯示所有文章

2021年5月24日 星期一

在Ubuntu中實現新舊版的Calibre同時可用來製作電子書

  在Ubuntu中使用Calibre有一點麻煩,就是Ubuntu自帶的2.5.5版Calibre可輸入中文,方便更改錯別字,卻不能加「簡繁中文轉換」的外掛;而由網路安裝新版的Calibre就不能輸入中文,卻能加「簡繁中文轉換」的外掛,方便作簡轉繁、橫式直式轉換。

  而在新版、舊版間,只能安裝一種,所以要嘛無法輸入中文,要嘛不能加好用的外掛。之前只好偶而安裝新版、偶而安裝舊版,總覺得麻煩。

  今天,由於在安裝舊版的情況下,檢使用新版功能,先試著安裝最新版(5.18.0),安裝後發現不能安裝「簡繁中文轉換」的外掛,只好到網路上下載3.46版(calibre-3.46.0-x86_64.txz),試著解壓縮後使用,結果發現它不用安裝就可以使用了,而且還自帶了「簡繁中文轉換」的外掛,真是太方便了。

  最後再從Ubuntu軟體中心安裝舊版的Calibre,方便更改錯別字時可輸入中文。


  現在的情況是:

  1. 要輸入中文,就從系統開啟舊版的Calibre或ebook-edit或ebook-viewer;
  2. 要使用使用「簡繁中文轉換」的外掛來做簡繁轉換或橫式直式轉換,就從檔案管理的Calibre資料夾下開啟新版的Calibre或ebook-edit或ebook-viewer。

 

 

 

2019年9月24日 星期二

Ubuntu 16.04 64Bit 安裝PDF閱讀器Foxit Reader

  Ubuntu 16.04自帶有文件檢示器可用來閱讀PDF等文件,但無法更改背景色——有時白色實在太刺眼了。

  安裝Foxit Reader 可以設定背景色和文件顏色,通常背景設定為綠色,讀起來舒服多了。

  在網路上找到安裝 Foxit Reader的方法,記錄下來,方便大家,以後自己要重裝也方便找得到!☺


  1. 按 [Ctrl — Alt — T]開啟終端機
     
  2. 複製/貼上以下命令來取得64bit的Foxit Reader:
    wget http://cdn01.foxitsoftware.com/pub/foxit/reader/desktop/linux/2.x/2.4/en_us/FoxitReader2.4.1.0609_Server_x64_enu_Setup.run.tar.gz
     
  3. 複製/貼上以下命令解開壓縮檔:
    tar -xvf FoxitReader*.tar.gz
     
  4. 複製/貼上以下命令:
    chmod +x FoxitReader.enu.setup.2.4.1.0609"(r08f07f8)".x64.run

  5. 複製/貼上以下命令,依指示安裝:
    sudo ./FoxitReader.enu.setup.2.4.1.0609\(r08f07f8\).x64.run
     
  6. 依出現問題回答,直至安裝完成。

2019年3月31日 星期日

Ubuntu不用命令式--搜尋檔案及批次重新命名

  在Linux中搜尋檔案或批次改檔名有命令式可以使用,如find和rename。但對我這個懶人(常忘記命令格式——超佩服鳥哥和阿舍)來說,每次都要重新查找命令格式,有時找到的命令格式還不能使用,然後出現一堆英文嘰哩咕嚕的→複製,貼到Google翻譯,看到底出什麼問題→再試一次,不行→重新搜尋。

  最後就是去找「套件」來用,記錄下來下次記得用:(目前系統Mint 17.2)

一.找檔案:
 
1.Catfish檔案搜尋:附屬應用程式 → 點開「Catfish」 → 點左上角設目錄,若沒有看到,則點「其他」 → 搜尋框中輸入部分檔案名稱 → 點搜尋

2.搜尋檔案(gnome-search-tool):附屬應用程式 → 點開「搜尋檔案」 → 點資料夾 → 輸入部分名稱 → 點右下角「尋找」;可以設定「選擇更多選項」限制搜尋範圍。

二、批次改檔名:

1.Thunar的附屬套件:附屬應用程式 → 點開「批次重新命名」 → 點「+」選資料夾內檔案(想改的都選取,或選全部) → 在「搜尋」框輸入欲更改部分 → 在「取代目標」輸入要改成的樣子 → 點「重新命名」,馬上就完成了。

  以後就不用再到網路尋找命令式了。

2018年3月25日 星期日

Ubuntu中批次修圖的好工具──XnView

最近接到的掃描圖檔,開啟後,覺得有些頁面太暗了(應該是用灰階格式掃的),看起來眼睛較吃力。於是到網路上查查是否有批次處理圖檔(頁面調亮)的工具,就找到有人推薦以前曾安裝過的XnView。

★下載XnView新版
※※※※※※
★或直接安裝:

For 32 bit
sudo apt-get install gdebi

wget http://download.xnview.com/XnViewMP-linux.deb

sudo gdebi XnViewMP-linux.deb
  
For 64 bit
sudo apt-get install gdebi

wget http://download.xnview.com/XnViewMP-linux-x64.deb

sudo gdebi XnViewMP-linux-x64.deb
※※※※※※
raw、jpg……等圖檔或已製作成的pdf,都可匯入加以批次處理:
1.建立資料夾(OCR01)
2.圖或pdf檔copy至OCR01
3.開啟XnView
4.點選OCR01中要轉換的檔案(一個或多個)→工具/批次轉換

5.設定:若pdf圖像不清楚,〔載入格式設定/增加解析度〕
6.輸出:
 (1)[多頁檔仍轉為多頁檔〕打鉤。
 (2)設定輸出資料夾位置(可在原資料夾)。
7.動作:以下任一選項或組合,先用少數檔案測試看結果如何,再批次處理
 (1)自動對比+(過濾)銳化82
 (2)(對映)(調整:例:亮度16/對比52/γ值1.84)
 (3)色階(黑30/白160)
 (4)(過濾)減少雜訊


2018年3月2日 星期五

Linux(Ubuntu)中從實體書(pdf)製作電子書及txt文件合併

友人掃描了實體書(雙頁掃描)要製成電子書,我從網路上搜集了資料,最後列出了各個步驟,紀錄下來,以便日後參考:

★★縮小超大pdf頁面(調整pdf頁面大小):

  1. 連結到 https://www.pdf2go.com/zh/resize-pdf 網頁 → 上傳pdf檔 → 下載
  2. 開啟終端機:gs -q -sDEVICE=pdfwrite -dBATCH -dNOPAUSE -dFIXEDMEDIA -dPDFFitPage   -dDEVICEWIDTHPOINTS=595 -dDEVICEHEIGHTPOINTS=842 -sOutputFile=out01.pdf a.pdf
    (此為使用ghostscript調整pdf頁面大小;595,842為A4大略大小)(還有-dPDFSETTINGS=ebook 設定pdf質量為中等)(還有-r96: 設定分辨率為 96 DPI)
  3. 開啟終端機:gs -q -sDEVICE=pdfwrite -dBATCH -dNOPAUSE -dFIXEDMEDIA -dPDFFitPage   -r96 -sOutputFile=out01.pdf a.pdf
  4. 可用的 gs 圖形介面下載:https://drive.google.com/file/d/1nM-Tbbj2h6N0MRsxBQHbfR9-iWzYVeAb/view?usp=sharing

★★將多個pdf檔合併成一個pdf檔:pdfunite *.pdf out.pdf

★★逐頁拆分PDF文檔:pdftk a.pdf burst

★★提取a.pdf的第1頁~第50頁,並合併為01.pdf:pdftk a.pdf cat 1-50 output 01.pdf

★★改檔名:rename -v s/up/dn/ *(將up檔名改為dn)


一、建book資料夾→將掃描檔剪下貼到book中→檔名改為a-all.pdf
 
二.pdf裁切出上、下頁輸出為ppm(需測試)
 [大本書]
(1)上頁: pdftoppm  -x 60 -y 50 -W 1060 -H 710 a-all.pdf up
★建目錄 up 存所有up檔
(2)下頁: pdftoppm -x 60 -y 850 -W 1060 -H 730 a-all.pdf dn
※※※※※※※※※
  [小本書]
(1)上頁: pdftoppm -x 260 -y 150 -W 2000 -H 1500 a-all.pdf up
★建目錄 up 存所有up檔
(2)下頁: pdftoppm -x 230 -y 1920 -W 2060 -H 1500 a-all.pdf dn
【註】若加入 -jpeg 條件則會輸出jpeg圖,但輸出時間較長,檔案較大。
★★xxx

※※※※※※※※※

★若要輸出PNG檔

  則:pdftoppm -png -x 60 -y 50 -W 1060 -H 710 a-all.pdf up

★若要輸出jpeg檔

  則:pdftoppm -jpeg -x 60 -y 50 -W 1060 -H 710 a-all.pdf up

★一般內定解析度為150,若要指定解析度(如300DPI)用-r係數

  則:pdftoppm -r 300 -x 60 -y 50 -W 1060 -H 710 a-all.pdf up

★若要將資料夾內所有的png轉為jpeg

   則:mogrify -format jpg *.png

 
三.改檔名,以便合併pdf時,依頁數順序合併:
(1)到up中:(合併時,1-1.ppm在1.ppm之前)
rename -v s/.ppm/-1.ppm/ *
(即在原檔名後加上 -1,合併時順序會在前面)
(若橫式書本,左右頁相反,則改dn的檔名)
=============
(2)在up中:
rename -v s/up/dn/ *(改為檔名都是dn開頭)

★★xxx
四.Copy dn中檔案至up中,並將原a-all.pdf留下,以便合併

★★xxx
五.在up中,合併
(1)每個pdf檔60頁,傳到Google硬碟辨識用
convert dn-00*.ppm dn-01*.ppm dn-02*.ppm dn-03*.ppm dn-04*.ppm a-0004.pdf

convert dn-05*.ppm dn-06*.ppm dn-07*.ppm dn-08*.ppm dn-09*.ppm a-0509.pdf


【註】2022/12/07此轉換已失效,需執行以下2行,才能使用:
(1)
$ sudo nano /etc/ImageMagick-6/policy.xml  (或從檔案找etc)
(2)找到<policy domain="coder" rights="none" pattern="PDF" />改為<policy domain="coder" rights="read|write" pattern="PDF" />

【註】形成pdf後要打開來看看頁數是否符合。
【註】辨識:在Google硬碟→右鍵→以Google文件開啟→辨識完,全選copy到純文字文件軟體
==============

(2)在up中,壓縮後(作單頁辨識用)
gs -sDEVICE=pdfwrite -dCompatibilityLevel=1.4 -dPDFSETTINGS=/printer -dNOPAUSE -dQUIET -dBATCH -sOutputFile=a-0004new.pdf a-0004.pdf
(所得的單頁pdf比原檔小很多)
【註】形成pdf後要打開來看看總頁數是否符合。

(注意:轉換成的 Google 文件,大小上限則是 50 MB。)
=============
(3)在up中,合併為全檔(作單頁校稿用)
gs -sDEVICE=pdfwrite -dCompatibilityLevel=1.4 -dPDFSETTINGS=/printer -dNOPAUSE -dQUIET -dBATCH -sOutputFile=a-allnew.pdf a-*.pdf
(所得的單頁pdf比原檔小很多)
【註】形成pdf後要打開來看看總頁數是否符合。

更改dpi大小:

-dPDFSETTINGS=/screen — 使用 72dpi,低品質且檔案較小。

-dPDFSETTINGS=/ebook — 使用 150dpi,品質較高但檔案稍大。

-dPDFSETTINGS=/prepress — 使用 300 dpi,高品質且檔案較大。

-dPDFSETTINGS=/default — 由系統選擇最理想的輸出模式,可能會產生較大的 PDF 檔案。


★★xxx

六.將辨識好的書本文字檔進行閱讀校正,貼到電子書製作軟體中,製成電子書。
七.將電子書丟入平板中以電子書閱讀軟體閱讀;檔案小又方便。

●●●●●●●●●●

八.若辨識出來的多個文字檔合併為一個文字檔:

 cat 01.txt 02.txt.... > all.txt

或

cat *.txt > all.txt   (要先將1~9的檔名前加上0,否則順序會錯誤)

★★★★★

九.要將docx檔轉換成pdf格式:

 libreoffice --invisible --convert-to pdf *.docx

★★★★★

十.將多個pdf檔合併成一個pdf檔:

pdfunite 1*.pdf out1.pdf

pdfunite *.pdf out.pdf
★★★★★
pdftk用來拆開、合併pdf檔,使用方法:
⑴將兩個PDF文檔合併為一個新的PDF:
pdftk 1.pdf 2.pdf cat output 0102.pdf
  
⑵如果合併資料夾中的所有pdf:
pdftk *.pdf cat output all.pdf
  
⑶從文檔中刪除頁面,例如第5~19頁,並且必須使用-end指示文檔的結尾:
pdftk 01.pdf cat 1-4 20-end output 01-1.pdf
  
⑷逐頁拆分PDF文檔:
pdftk 01.pdf burst

(5)提取a.pdf的奇數頁,並合併為b.pdf
pdftk a.pdf cat 1-endodd output b.pdf
  
(6)提取a.pdf的偶數頁,並合併為c.pdf
pdftk a.pdf cat 1-endeven output c.pdf
  
(7)提取a.pdf的指定頁面,並合併為d.pdf
pdftk a.pdf cat 1 3 5 7-end output d.pdf
  
(8)提取a.pdf的第1頁~第100頁,並合併為e.pdf
pdftk a.pdf cat 1-100 output e.pdf
  
(9)提取a.pdf的第100頁~末尾,並合併為f.pdf
pdftk a.pdf cat 100-end output f.pdf

●●●●●
★pdfseparate命令的使用:
⑴從01.pdf中提取10~15頁──未合併,並且檔名用001標示
pdfseparate -f 10 -l 15 01.pdf %03d.pdf
  
⑵合併資料夾中所有pdf檔:
pdfunite a-* all.pdf
♠♠♠♠♠
★將 png 轉 jpg
ls -1 *.png|xargs -n 1 bash -c 'convert "$0" "${0%.png}.jpg"'

★將 jpg 轉 png 
ls -1 *.jpg|xargs -n 1 bash -c 'convert "$0" "${0%.jpg}.png"'
☀☀☀☀☀☀☀☀☀☀
將彩色pdf轉為黑白pdf,以便辨識
1.將 PDF 的每一頁擷取並轉為圖片
pdftoppm input.pdf AA -jpeg -rx 450 -ry 450
(rx 和 ry 各指定 x 維和 y 維的解析度,單位為 dpi,若未指定則用內定150)
或
pdftoppm -jpeg -r 300 -x 60 -y 50 -W 1060 -H 1710 input.pdf AA
(-r為解析度;x y 為距左、上的像素;W H為寬和高。可忽略)
pdftoppm -jpeg -r 300 a.pdf AA
  
2.將這些圖片批次用 convert 轉成黑白圖片。
for file in $(ls AA*.jpg) ; \
do convert $file -threshold 67% result-$file.jpg; \
done ;
(註:圖形檔為png,則將jpg改為png)
(-threshold 區分黑白和彩色的閾值參數(範圍為0-100%),這裡設定為67%。)
  
註:在Kbuntu 22.04LTS中該批次好像無效,只好用Xnview轉換!

3.將這些生成的圖片結合成新的 PDF:
convert *.jpg output.pdf

(以上參考:https://blog.kianting.info/2020/02/14/ti-linux-tsiong-pdf-tshai-sek-tsuan-tso-oo-peh/)

2018年2月26日 星期一

Linux(Ubuntu)中pdf的拆解、合併、壓縮

由於看到友人傳來的pdf檔太大,在彼此間共享不方便,於是在網路上搜尋pdf檔案壓縮的方法,將有關pdf的拆解、合併、壓縮整理如下:

一、pdf的拆解:
1.(1)使用pdftoppm將pdf拆解為一張張ppm、jpeg、png、tiff圖
   #  pdftoppm [options] [PDF-file] [PPM-file-prefix]
 ※例 pdftoppm a.pdf a (將a.pdf拆為一張張ppm圖檔)
 ※ [options]:-f 起始頁 -l 終止頁 -r (DPI) [png/jpeg/tiff]
     (-r:內定150DPI)
   ※Help:pdftoppm -h

   (2)一次掃2頁的圖,將pdf每頁裁切為2頁(先單頁後雙頁)ppm
    例: pdftoppm -jpeg -x 60 -y 80 -W 640 -H 360 input.pdf output
      (裁切一個寬度為 640 像素、高度為 360 像素的區域,此區域距離左邊界 60 像素、距離上邊界 80 像素)
   例:單頁:pdftoppm -x 200 -y 130 -W 2050 -H 700 abc.pdf up 
       雙頁:pdftoppm -x 230 -y 1550 -W 2050 -H 700 abc.pdf dn

   ★注意:每本書掃描的大小可能不同,需測試(輸出幾頁暫停[Ctrl+C])。
    (安裝xdotool,# xdotool getmouselocation,再求滑鼠座標差,可得到各座標大約數值)

★參考:Linux將PDF轉為圖片檔的指令教學與範例 (說明詳盡)
==============
2.(1)使用 ImageMagick 將 PDF 檔拆解為一張張 JPG 圖片檔
 例:(1)# convert input.pdf output.jpeg (預設72DPI)
      (2)# convert -density 300 input.pdf -quality 90 output.jpg
  (-density=dpi值;-quality=圖片壓縮層級)
 ※輸出其他格式的圖檔,就直接更改輸出檔名的副檔名即可(如png)。

  (2)只抽取部分頁面:頁碼從 0 開始算起
    # convert -density 300 input.pdf[4] -quality 90 output.jpg(只有第5頁)

    # convert -density 300 input.pdf[0-2] -quality 90 output.jpg(只抽取前三頁)
 (3)加上 -trim 讓 ImageMagick 自動把白邊去除
   # convert -density 300 input.pdf -quality 90 -trim output.jpg
(ImageMagick 去除白邊的方法是以最角落的像素顏色為準,凡是跟最角落像素的顏色相同的邊緣就自動去除,如果想要放寬判斷邊緣的標準,可以使用 -fuzz 來指定放寬的門檻值[-fuzz distance{%}]。)
(4)若要將轉出來的圖片進行裁切,可以加上 -extract 參數:
例:# convert -density 300 -extract 960x540+180+220 input.pdf output.jpg
(寬960像素、高540像素的區域;距左邊界180像素、距上邊界220像素)

★參考:Linux將PDF轉為圖片檔的指令教學與範例 (說明詳盡)
★參考:用ImageMagic將PDF轉成高品質圖
==============
3.用pdftocairo將pdf拆解為一張張jpeg或png(或壓縮為另一個pdf檔)
   # pdftocairo [options] <PDF-file> [<output-file>]
  ※例:
 (1)pdftocairo -jpeg a-1.pdf a-1 (將a-1.pdf拆為a-1-01.jpg、a-1-02.jpg……)
 (2)pdftocairo -jpeg -f 3 -l 5 a-1.pdf a-1(將a-1.pdf分離出第3頁到第5頁為a-1-03.jpg、a-1-04.jpg、a-1-05.jpg)
※要看參數用法: pdftocairo -h
※拆為jpeg較快,檔案較小;拆為png很慢,檔案很大。
※ [options]=png/jpeg/pdf/ps/eps/svg
※參數 [-r]為解析度,內定為150PPI
參考網站:Ubuntu Manpage: pdftocairo
=============
4.使用 GhostScript 將pdf轉為一張張 jpg或png
  (1)將 PDF 檔轉為 JPG 圖片檔
# gs -dNOPAUSE -dBATCH -sDEVICE=jpeg -r300 -sOutputFile='page-d.jpg' fnli.pdf

  (2)將 PDF 檔轉為支援透明度的 PNG 圖片檔
# gs -dNOPAUSE -dBATCH -sDEVICE=pngalpha -r300 -sOutputFile='page-d.png' fnli.pdf
★參考:Linux將PDF轉為圖片檔的指令教學與範例 
=============
5.(1)用pdfimages擷取pdf中所含有的圖片(有文字有圖片者可用)
 # pdfimages -all input.pdf output
   (預設也是會將圖片儲存成 ppm,而加上 -all 可以原始格式儲存)
  (2)# pdfimages -list input.pdf
       (僅列出pdf中圖片清單)

  (3)若要讓圖片檔名加上頁碼
    # pdfimages -all -p input.pdf output

★★xxx★★xxx★★xxx
二、pdf的合併:
1.將多頁ppm合併(會壓縮為6/10)為一個pdf

  # convert <ppm-file> <output-file>
  例:convert a-0?.ppm a-1?.ppm a-0.pdf (將a-0及a-1開頭的所有ppm,依檔案名稱順序壓縮、合併成一個pdf檔)
【註】合併前若要改檔名以符合順序:
★批次改檔名:
  # rename  s/檔名的原始字串/新的檔案字串/  要變更的檔案類型
例:
(1)把所有檔案名稱中有 xyz 的部份都改成 aaa
   # rename -v s/xyz/aaa/ *
(加上 -n 先預覽執行結果,確定後再執行;加上 -v 是把檔案都列出來;加上 -w 來覆寫現有檔案)
(2)更換副檔名:
  例:把 .html 置換成 .txt,其它不變。
  # rename -v s/\.html$/\.txt/ *html
 參考:Ubuntu用指令大量更改檔案名稱
==============
2.若不壓縮,將兩個以上pdf合併成一個pdf
 (1)安裝pdftk: # sudo aptitude install pdftk
 (2)pdftk <1.pdf> <2.pdf>……cat output <output-file>
 (3)例:
  ㊀pdftk 1.pdf 2.pdf 3.pdf cat output 123.pdf (1、2、3三個pdf合成一個pdf)
  ㊁pdftk *.pdf cat output all.pdf (目錄內所有pdf合成一個pdf)
==============
3.將一個pdf中的某幾頁分離出來合併成一個pdf
   # pdftk A=a.pdf cat A3-5 output dd.pdf (將a.pdf中取第3到5頁合成一個dd.pdf) 

  #例:pdftk A=a-all.pdf cat A1-5 output 0105.pdf (將a-all.pdf中取第1到5頁合成一個0105.pdf)
==============
4.在不同pdf檔中取出各頁並合併成一個pdf
   # pdftk A=a0.pdf B=a1.pdf cat A1-2 B1-3 A8 output ABC.pdf (在a0中取1~2頁,在a1中取1~3頁,在a0中取第8頁;將以上各頁依序合併成ABC.pdf)
★★xxx★★xxx★★xxx
三、pdf的壓縮+合併

1.用Ghostscript(若出現未安裝,可到synaptic安裝)
   # gs -sDEVICE=pdfwrite -dCompatibilityLevel=1.4 -dPDFSETTINGS=/printer -dNOPAUSE -dQUIET -dBATCH -sOutputFile=output.pdf input.pdf


※-dPDFSETTINGS 變數有四種:(原始檔105.4Mb)
(1)/screen (檔案最小(6.3Mb)[和/ebook同][72dpi],壓縮時間長,最不清楚)

(2)/ebook (檔案最小(6.3Mb)[和/screen同],壓縮時間長,最不清楚)
(3)/printer (檔案第二大(10.2Mb),壓縮時間最短,第二清楚) --首選
(4)/prepress  (默認;檔案最大(18.1Mb),壓縮時間第二長,最清楚)

※若不用[-dPDFSETTINGS]參數,可用以下代替:(自行測試)
-dDownsampleColorImages=true \
-dDownsampleGrayImages=true \
-dDownsampleMonoImages=true \
-dColorImageResolution=72 \
-dGrayImageResolution=72 \
-dMonoImageResolution=72 \
 ※※※※※※
★例:若要將多個pdf壓縮並合併為一個pdf檔,則可如下:
 # gs -sDEVICE=pdfwrite -dCompatibilityLevel=1.4 -dPDFSETTINGS=/printer -dNOPAUSE -dQUIET -dBATCH -sOutputFile=a-012T.pdf a-0.pdf a-1.pdf a-2.pdf  (將a-0、a-1、a-2pdf檔壓縮並合併為較小檔案a-012T.pdf)
=============
 2.將多頁ppm壓縮(6/10))並合併為一個pdf
  # convert <ppm-file> <output-file>
  ※例:convert a-0*.ppm a-1*.ppm a-0.pdf (將a-0及a-1開頭的所有ppm,依檔案名稱順序壓縮、合併成一個pdf檔)
=============
3.將pdf壓縮為另一個pdf檔
   # pdftocairo -pdf <PDF-file> [<output-file>]

參考:linux-優化pdf
參考資訊:Linux下pdf的編輯

2018年2月1日 星期四

不用辨識軟體--超大文字掃描圖形檔(pdf)中文辨識(OCR)攻略--pdf大檔的拆解、合併及壓縮

  曾經寫過〔辨識--好用的手機APP Google Translate;及網頁Google文件〕這篇文章介紹一點辨識的方法。但若pdf的檔案太大就不能傳到google硬碟辨識了(轉換 Google 文件,大小上限則是 50 MB。)。
  今天接到幾百Mb(有的有1Gb)的檔案,當然是不行囉!
  先是用手機拍照→google翻譯的辨識方法,但有些操作不便(要換頁、拍照、辨識後轉貼寄出),而且速度又慢,於是想辦法解決它。最後終於找到了解決的方法☺


1.安裝imagemagick:
  #sudo apt-get install imagemagick
2.將圖形pdf轉ppm
  #pdftoppm a.pdf a (將a.pdf拆為一張張ppm圖檔)
3.將多頁ppm轉pdf
  #convert a-0?.ppm a-1?.ppm a-0.pdf (將a-0及a-1開頭的所有ppm,依檔案名稱順序合併成一個pdf檔)
4.將大pdf檔壓縮為小檔案(安裝Ghostscript)
  # gs -sDEVICE=pdfwrite -dCompatibilityLevel=1.4 -dPDFSETTINGS=/printer -dNOPAUSE -dQUIET -dBATCH -sOutputFile=a-0T.pdf a-0.pdf (將a-0.pdf檔壓縮為較小檔案a-0T.pdf)

5.將轉好的pdf檔傳到Google硬碟。
6.傳上去後,按右鍵,選擇使用google文件開啟,等一下了就幫你辨識好了。
7.按[Ctrl+A]全選,複製貼到文字檔,OK
======
附註1:若是pdf本來就是文字格式轉成的,那麼直接轉換即可
  #pdftotext a.pdf a.txt
======
附註2:網路上有人介安裝tesseract辨識軟體,經測試結果,英文沒問題,中文則不管橫式或直式都不行(橫式中文效果稍好,但還是不行),方法如下:
1.安裝:
  #sudo apt-get install gocr
  #sudo apt-get install tesseract-ocr
  #sudo apt-get install libtiff-tools
2.安裝tesseract-ocr後,到synaptic安裝語言包
(或到官網上下載中文語言包,比如繁體的就是chi_tra(簡體chi_sim),然後加入到一個環境變量中
  #sudo mv chi_tra.traineddata /usr/local/share/tessdata
  #export TESSDATA_PREFIX=/usr/local/share/
3.執行辨識
  #tesseract a1.ppm a1.txt -l chi_tra
(若發生錯誤訊息,則登出再登入,即可執行)

2018年1月31日 星期三

完全解決--你的電腦網頁、文書、電子郵件……還會缺字嗎?還有框框字嗎?

  近日看電子書時,發現書中有靈提(應該是靈𤟥(左犭右是)【你的桌機可能看不到這個字】)的名詞,就試著要糾錯,可是我的桌機竟也打不出「𤟥」這個字,到(http://www.unicode.org/cgi-bin/GetUnihanData.pl?codepoint=247E5)這個網頁上查到的是框框字。
 
  為了解決這個字,到網頁上尋找含有最多字的字型檔;以前曾接觸過【中文全字庫】,也下載安裝了其中的楷字,但沒有出現這個字。於是再到這個網站去瀏覽,發現有加了一些Unicode的字,重新下載全字庫字型→移除舊字型→安裝【全字庫正楷體】及【全字庫正宋體】→重新開機→將系統字型設定為【全字庫正楷體】。【𤟥】字跑出來了,其他一些網頁上的框框字也都出現了--因為它共有108018個字呢!(資料在這裡)

  如何下載及安裝中文全字庫:
1.到(政府資料開放平台)CNS11643中文標準交換碼全字庫(簡稱全字庫)網頁,點(資料資源)【ZIP】,就會跳出下載頁面(因為有數種資料,共有約252Mb),所以慢慢讓它去下載吧!
2.下載後解壓縮,可以看到(Open_Data)這個資料夾內,有(Fonts)資料夾,內有8個檔,打開其中的說明檔.txt,就可知道了。
3.(若已曾安裝同一字型檔需先移除)在楷體中的3個檔都快按2下→安裝,就會安裝好字型檔。
4.重新載入字型檔(sudo fc-cache -f -v),設定系統字型、網頁字型等。→此步驟若不會,直接重開機再設定字型較快。
5.登出再登入或重開機,設定字型就成功了。
  除非又有新字出現(在臺、中、日、韓、越、新等這些使用中文字型的國家三不五時就會發現有新字〔古書、姓氏等〕未列入,於是又有新字要增加了),否則你的電腦就再不會出現框框字了。

  另外一提,雖然Google和Adobe共同推出了【思源字型(下載頁)】(搜尋CJK找到字型下載)希望網頁上沒有框框字,不過我下載安裝後,「𤟥」這個字依然出不來。不過它的字也不少,一般來講也夠多了!(每個字型有65535字)--電腦玩物有介紹下載及使用方法。

2016年10月29日 星期六

網路分割pdf檔──Smallpdf.com

由於製作電子書需要將pdf檔分割為圖片,再用google文件辨識,於是上網找到一個不錯的分割pdf檔的網站。

Smallpdf.com 線上PDF 轉檔、合併、分割、壓縮工具

  1. 進入網頁後,在最上方〔功能列-轉換、合併與分割〕選取你要的功能。
  2. 然後上傳檔案。
  3. 上傳完畢後,選取次要功能。
  4. 等一段時間就完成。
  5. 下載你需要的檔案(壓縮檔)。
  6. 解壓縮即完成。

 ※若偶而用之,不用註冊、付款。一小時內可處理兩個檔案。(大小好像沒限制,我傳了一個四十幾M的檔案,一樣可處理)
★★註:找到更好的方法了:
1.安裝imagemagick:
  #sudo apt-get install imagemagick
2.將圖形pdf轉ppm,會自動分頁(太帥了)
  #pdftoppm a.pdf a
3.將多頁ppm轉pdf
  #convert a-0?.ppm a-0?.pdf (會將a-0開頭的所有頁數一次轉成一個pdf檔)
4.將轉好的pdf檔傳到Google硬碟。
5.傳上去後,按右鍵,選擇使用google文件開啟,等一下了就幫你辨識好了。(一次辨識20頁<33Mb>沒問題,約2~3分鐘)
6.按[Ctrl+A]全選,複製貼到文字檔,OK


2016年9月24日 星期六

辨識--好用的手機APP Google Translate;及網頁Google文件

  要將一篇PDF辨識為文字檔,可以用軟體分割成一頁一頁,然後用OCR 辨識。雖然OCR 軟體用起來方便,但當掃描檔不是很清楚時,它的辨識率就不高。若改用〔Google文件〕辨識或手機拍下後用〔Google翻譯〕辨識,則辨識率要好得多。

  若在分割成一頁一頁之後,可:

  1. 上傳至gmail網路硬蝶。
  2. 右鍵→選擇開啟工具→Google文件,就會自動辨識(上方是原件,下方是辨識結果)。
  3. 辨識率還不錯,複製下來即可。(有些頁數會不分段,得自行分段)


  若不想分割文件即辨識,則可:

  1. 在電腦開啟PDF檔。
  2. 再開啟手機 Google翻譯(手機先安裝Google翻譯,設定由繁體中文翻譯為繁體中文)。
  3. 然後用手機拍下,就會自動辨識。(所有內容皆不分段);若嫌螢幕太小,可以將pdf開啟後,逆時鐘旋轉90度,手機也逆時鐘旋轉90度來拍,一樣可以辨識☺
  4. 再分享到Gnail或記事本(後者會自動一頁一頁往下貼,較方便),也可以用複製→貼上到記事本。
  5. 寄給自己,就有一份辨識好的文件了。




2015年8月28日 星期五

在Ubuntu中將youtube影片下載為ogg+將下載的mp3等轉換為ogg+合併MP3檔

為了讓寶寶好睡,下載了youtube中的嬰兒睡眠音樂影片3gp檔,試了一下,發現待命中的手機及平板不能播(待命中播音樂用〔play音樂〕軟體),只好找下載轉為ogg的軟體。

在網路上有一款〔4K視頻下載器〕,安裝後即可用來下載youtube中的影片轉為ogg音樂檔了。

參考網址:https://www.4kdownload.com/zh-cn/howto/howto-download-songs-from-youtube

1.下載後安裝
2.在[選單]中打開[4K Video Downloader]置於右側
3.點[智能模式] ,設定[格式]為ogg,儲存的[檔案夾]位置
4.開啟火狐瀏覽器,搜尋youtube影片
5.在網址列全選→複製
6.在[4K視頻下載]上,點選[粘貼連結],即自動轉檔並下載到設定的[檔案夾]中

======
今天下載了兒童故事mp3,要轉為ogg,以下是它的方法:

安裝 Audacity:

多語使用者介面(切換時必須重新開啟)
匯入與匯出 WAV、MP3、Ogg Vorbis或者其他的聲音檔案格式
從1.3Beta開始支援MP4、MOV、WMA、M4A 、AC3檔。
========

下載了MP4要轉檔為ogg,還可以安裝SoundConverter

  1. 到「Ubuntu軟體」安裝
  2. 安裝後搜尋sound就會出現「音效轉檔器」
  3. 打開後→「編輯」→偏好設定(格式、儲存位置……)
  4. 加入檔案→點選(一個或全部)→轉換

==============

用一個命令,在Ubuntu中將多個mp3(ogg)檔合成一個檔:
開啟終端機,轉到音樂目錄,下命令:

cat *.mp3 >> [新文件].mp3
★若為ogg檔分則mp3改為ogg即可。
(參考:https://www.iwaishin.com/mac-linux-merge-mp3-files/)
========
通過命令行將mp3文件全部轉換為ogg:
1.安裝dir2ogg
sudo apt-get install dir2ogg

2.開啟終端機,下命令:
dir2ogg -r /mp3path((將mp3path目錄下的所有mp3文件轉換為ogg))
(參考:https://ubuntuqa.com/zh-tw/article/1843.html)

========
將ape檔轉換為320Kb mp3:
開啟終端機,貼上以上命令列(若有缺軟體則補上)
$ for f in *.ape; do
      avconv -i "$f" -id3v2_version 3 -codec:a libmp3lame -ab 320k "${f%.ape}.mp3"
done

2014年3月12日 星期三

一個超好用超方便的國字(中文)查詢線上字典--萌典

在國字查詢方面,有時查讀音,有時查兩岸說法的不同,有時查意義,有時查成語……
有一個線上字典可以滿足各種查詢(但欠缺圖形),而且快速,隨打隨查,很方便

它就是「萌典」,網址= https://www.moedict.tw/%E8%90%8C 

★它有「國語辭典」、「臺灣閔南語辭典」、「臺灣客家語辭典」、「兩岸詞典」
★在查出的字詞中,還可以點擊各個字或詞向下查。
★當查到資料時,也可以按上方的小圖示轉到「教育部國語辭典」(該字典若要連續查詢時,老是跳出小視窗要你重新整理,實在不便啊!)
★它是android APP,所以可以下載安裝在手機、ipad 上,應該非常方便:
 網址:https://play.google.com/store/apps/details?id=org.audreyt.dict.moe
 
 一、「國語辭典」下有
  1.「分類索引」:有「成語」、「諺語」、「歇後語」、「外來語」、「專科語辭」,可以點開來查。
  2.「部首表」 :列出各個部首,點各個部首,則出現該部首的所有字,點該字,則可查詢該字的各種資料。

二、「臺灣閔南語辭典」下有「分類索引」、「諺語」,請自行點入體驗

三、「臺灣客家語辭典」下有「諺語」,請自行點入體驗

四、「兩岸詞典」下有「分類索引」、「部首表」,請自行點入體驗

在萌典網站上的資訊如下:
說明
» 收錄十六萬筆國語、兩萬筆台語、一萬四千筆客語條目,以及常用字的筆順動畫,不需網路連線即可檢閱。
» 有網路連線時可播放國語常用條目、台語及客語條目名稱的真人發音。
» 定義裡的每個字詞都可以輕按連到說明。
» 萌典線上版網址:https://moedict.tw/
» 字典來源為教育部《重編國語辭典修訂本》、《臺灣閩南語常用詞辭典》及《臺灣客家語常用詞辭典》。
» 筆劃資料來源為教育部《常用國字標準字體筆順學習網》。
» 國語發音資料來源為教育部《國語辭典簡編本多媒體網路版》。
» 中英/中法/中德對照來源為 CEDict、CFDict、HanDeDict,採用 CC-BY-SA 3.0 授權。
» 源碼、其他平台版本、API 及原始資料等,均可在 http://3du.tw/ 取得。本程式內含下列第三方元件:
* jQuery 及 jQuery UI 由 jQuery Foundation 採用 MIT 授權。
* cordova.js 由 Apache 基金會採用 Apache v2 授權。
* Fira Sans 字型由 Mozilla 基金會採用 Apache v2 授權。
感謝 #g0v.tw 頻道內所有協助開發的朋友們。

2014年3月11日 星期二

有關有 Ubuntu 中下載文件、影集等大物件的方法

若你有一個幾百MB的物件要下載,有三個方法:
1.按右鍵/另存新檔:最慢的;大檔案有時下載到一半會斷線,得重新來
2.在火狐(FireFox)安裝〔附加元件〕/[DowmThemAll]:右鍵/[DowmThemAll選擇],速度普通快,斷線可按暫停,再按繼續即可下載完。--一般中等到大檔安皆可用。
3.安裝 multiget :到下面網址下載32或64位元deb版本--最快,會自動偵測連結,不會斷線
http://pkgs.org/ubuntu-12.04/ubuntu-universe-amd64/multiget_1.2.0-3_amd64.deb.html
下載後安裝,不要安裝Ubuntu 網站內的版本(有缺少一點點東西,不好用)
 (1)下載後,雙擊檔案安裝
 (2)到[選單]/[網際網路],點擊 multiget 開啟
 (3)若覆蓋整個畫面,則在右上角小圖示/右鍵/點一下[顯示拖放窗口],就會正常;然後到[文件]/[保存當前配置]
 (4)內定[監視剪貼板],只要複製下載網址,就會出現新下載任務(若沒出現,就點〔任務〕/〔新建〕,就出現了)
 (5)若沒法複製下載網址,則按右鍵,先用火狐下載,然後到火狐/〔工具〕/〔下載〕 /右側,按右鍵〔暫停〕,再右鍵〔複製下載連結〕,就可在 multiget 中下載了。
 (6)在〔重命名〕中先命名,免得下載後還要改名。

2014年2月5日 星期三

在火狐(Firefox)和Google Chrome中破解迅雷、快車(Flashget)及旋風下載

偶而要下載一個文件,網頁卻出現需要用Flashget下載,
在ubuntu中要裝這些東東有點傷腦筋哩!
乾脆找破解附加元件(插件)較快:

一、火狐(Firefox):

  1. 到〔专用链破解 Special Links Converter〕
  2. 【使用說明】
    (1)你必須使用Firefox瀏覽器
    (2)你必須安裝GreaseMonkey插件 https://addons.mozilla.org/zh-CN/firefox/addon/748
    (3)在安裝完GreaseMonkey之後,你在安裝地址網頁上點擊頁面右上角的Install 按鈕,就會自動彈出GM腳本的安裝對話框。
  3. 安裝後,下載的網址就正常囉!

二、Google Chrome:
  1. 到[自動破解迅雷、快車、旋風專用鏈] 
  2. [Chrome插件資訊]下,[點我安裝],安裝後在網址列右方出現小圖示
  3. 看原網頁說明

Ubuntu中pdf的分割、旋轉、合併等

為了測試在 Google doc 中辨識文字,將PDF檔分割一頁下來
在網路上搜尋,找到[海豹雜記]中有關PDF檔的處理軟體的安裝及說明,
COPY一部分在此,以便參考:
一、PDF-Shuffler
PDF-Shuffler 可以協助使用者合併或分割 PDF 檔,另外也可以對 PDF 的每一頁做旋轉、切割或重新排序。事實上他就是 python-pyPdf 的一個圖形化使用者介面。
在 Ubuntu Linux 下可以用 apt 直接安裝:
sudo apt-get install pdfshuffler
二、PDF Split and Merge(PDFsam)
PDF Split and Merge 是用 Java 語言寫成的,其 basic 版本只有提供使用者分割或合併 PDF 檔的功能。
PDFsam 的 basic 版本在 Ubuntu 下可使用 apt 安裝:
sudo apt-get install pdfsam
三、PDF Mod(最好用)
PDF Mod 功能與 PDF-Shuffler 類似,但是其功能更多,除了對 PDF 的每一頁做旋轉、切割或重新排序外,還可以編輯 PDF 的書籤、metadata(author, title, subject and keywords)等,另外其使用者介面也做的更好,有許多選項可用,操作起來也很直覺,若是一般的 GNOME 桌面使用者筆者很推薦使用 PDF Mod。
在 Ubuntu 下可用 apt 安裝 PDF Mod:
sudo apt-get install pdfmod
四、PDF Chain
PDF Chain 是一個很簡單的 PDF 編輯程式,與 PDFsam 很相似,都只是提供一個圖形介面輸入參數而已,不過多了一些像加入背景圖片、附加檔案等功能,除此之外都差不多。
在 Ubuntu 下可使用 apt 安裝 PDF Chain:
sudo apt-get install pdfchain

★安裝後,PDF Mod在[附屬應用程式],其餘軟體在[辦公]
★有關較詳細的使用說明,請參閱[海豹雜記]內容。

結果,在 Google doc 中辨識不出文字來☹,以後再試試看囉!

2013年7月21日 星期日

Ubuntu開啟djvu電子書檔

在Ubuntu中開啟pdf,epub,djvu和chm格式的文檔,電子書。
1.閱讀pdf,djvu可以使用evince。
2.chm使用chmsee查看。
3.epub可以使用calibre帶的查看器,或者使用firefox的插件。

安裝命令
sudo apt-get install evince
如果pdf亂碼,可能需要使用poppler-data
sudo apt-get install poppler-data
sudo apt-get install chmsee
sudo apt-get install calibre

電子書管理:很多電子書,需要一個管理工具calibre
安裝命令
sudo apt-get install calibre



--轉貼自[ysyk的ubuntu軟件]

2013年3月14日 星期四

ubuntu開啟dwg檔

dwg檔是Autocad 一種圖檔,在建築圖上很常見,
ubuntu中可用 DraftSight 來開啟,
方法:
  1. 到下載網頁下載deb檔 :http://www.3ds.com/products/draftsight/download-draftsight/
  2. 然後直接開啟 draftSight.deb 安裝就可以用了  
  3. 若是64位元系統,則參考:〔DraftSight Ubuntu 上的 dwg格式 CAD 還是 freewarwe !〕 網頁中說明來安裝。
  4. 若有部分文字是???,則參考〔draftsight 中文部份顯示" ????????"〕 來解決
  5. 滾動滑鼠即可放大縮小,用〔工具列〕用的移動工具來移動檢視位置
 

2013年1月31日 星期四

在 Ubuntu 中,將 pdf 轉為文字檔

在 Ubuntu 中,要將 pdf 轉為文字檔
當然首先要確定這個 pdf 檔是由文字檔轉成的,
若是由圖片檔轉出來的 pdf 檔是沒辦法轉為文字檔的(要用辨識的方法)
要知道是不是由文字檔轉出來的 pdf 檔:
  1. 由 火狐 或 Google Chrome 網頁(Google Doc)開啟,試試能否用滑鼠選取
  2. 用 FoxitReader 等軟體開啟,試試能否用滑鼠選取

====
 將 pdf 轉為文字檔

★頁數較少時:
 
方法、用網頁開啟後,直接用滑鼠左鍵拖曳選取(一次可選數頁) →[Ctrl + C ]複製,貼到文件

★頁數較多時: 
方法一、用〔文件檢視器〕開啟後 →〔編輯〕/全部選取 →[Ctrl + C ]複製,貼到文件
 
方法二、用 FoxitReader 開啟後 →〔編輯〕/全部選取 →[Ctrl + C ]複製,貼到文件 
 
方法三、用指令法:(若為直式文章或無法選取的文章,則用此法)
  1. ubuntu 預設有安裝 poppler,若沒有裝,則到〔軟體管理員〕或〔Synaptic〕搜尋poppler,安裝
  2. 將下載的檔案複製到〔家目錄〕
  3. 開啟〔終端機〕
  4. 輸入指令 pdftotext 123.pdf 123.txt 或  pdftotext -raw 123.pdf 123.txt
方法四、安裝gPDFText
  1. 到synaptic
  2. 搜尋gPDFText,安裝
  3. 到〔附屬崖用程式〕,開啟 gPDFText ebook Editer
  4. 開啟 pdf 檔 →COPY →貼到文字編輯器上 →OK

2013年1月23日 星期三

Google Blogger中移除垃殼留言的方法

在其他部落格中,曾看到「不良的留言」,
這些留言留著無用又不雅觀--通常都是連到廣告或不良網站,
最好的方法是:
  1. 登入
  2. 點「新文章」→Blogger名稱,進入管理畫面
  3. 點「留言」
  4. 在垃圾留言前方打鉤選取 →點上方的「垃圾留言」
  5. 之後,只要是該網址傳過來的留言,自動歸入「垃圾留言」資料夾中☺
★當然你也可在登入後,點開「設定」/「文章和留言」中設定權限。

2013年1月12日 星期六

在Ubuntu中閱讀epub電子書

在 Ubuntu 中要閱讀 epub 電子書,在網路中找到兩個方法:
一、直接在火狐瀏覽器安裝附加元件:EPUBReader
  1. 〔工具〕/〔附加元件〕/〔搜尋〕,輸入 epub
  2. 找到 EPUBReader 按〔安裝〕
  3. 完成後重開火狐
  4. 由〔檔案〕/〔開啟檔案〕來開啟下載的 epub 檔即可開始閱讀
  5. 第一次使用會出現操作功能,如方向鍵翻頁等
    (不能用網頁〔簡/繁〕轉換)

二、安裝 Calibre
  1. 開啟〔軟體管理員(中心)〕,搜尋 Calibre
  2. 雙擊安裝(延伸套件也安裝)
  3. 開啟 Calibre ,設定暫存目錄(內定即可)
  4. 〔加入書籍〕
  5. 雙擊該書名稱,即可開啟該書(或點書名,按上方的〔檢視〕)
  6. 開啟書本後,在〔偏好設定〕(左下)可作設定
    (不知能不能作背景顏色設定,若能改為綠色,則較不傷眼)
  7. 可以用〔轉換書籍〕將 epub 檔轉為 PDF 或 TXT --轉為TXT,即可用 MadEdit 開啟,背景改為綠色,並將簡體轉為繁體,閱讀較方便,也較不傷眼
--Calibre可開啟的檔案格式相當多,推薦!
--開啟直式的 epub 檔,字未轉正,必需轉為PDF或TXT ,用其他軟體開啟