PDF testura — Doakoa, Tokikoa, LLMrako prest
Atera testua PDF batetik edo askotatik arakatzailean - hiru irteera-estilo, kargatu gabe, erregistratu gabe
Drop one or more PDFs onto the page. Every file is parsed locally in your browser and returned as a clean .txt — in your choice of three styles: Standard (Unix-style form-feed between pages), Joined (clean flowing text, best for feeding into ChatGPT / Claude / any LLM), or Numbered (each page prefixed with --- Page N --- for easy reading). 100% in-browser — your PDF never leaves your device.
Jarri zure PDFs hemen
edo
Ez da kargatu behar. Dena %100ean exekutatzen da zure arakatzailean.
Nola bihurtu PDF testura doan
1. Jaregin PDFs bat edo gehiago
Arrastatu PDFs goiko jaregin eremura edo egin klik arakatzeko. Fitxategi bakoitza lokalean aztertzen da; ez da ezer kargatzen zerbitzari batera. Fitxategi anitzeko loteak onartzen dira.
2. Aukeratu irteera-estilo bat
Estandarra (lehenetsia, Unix estiloko inprimaki-jarioa orrien artean), Joined (orrialde-jauzirik gabe, aproposa ChatGPT/Claude sarrerarako) edo Zenbakitua (orrialde bakoitzak --- N orrialdea ---rekin aurrizkia). Txartel bakoitzak .txt-ak zer edukiko duen azaltzen du.
3. Bihurtu
Egin klik Bihurtu testura. Orrialde bakoitzaren testu-geruza ateratzen da eta UTF-8 .txt fitxategi arrunt batean igortzen da. Nahiz eta 1000 orrialdeko PDF-ak segundo gutxitan amaitu ohi dira.
4. Deskargatu banaka
Prest pantailak PDF-ren .txt bakoitza bere deskarga gisa zerrendatzen du. Ez ZIPrik, ez artxiborik: garbitu fitxategi bakoitzeko botoiak, konprimitze-fluxuaren forma bera.
Zergatik erabili gure doako PDF testu bihurgailua?
Benetan Aske, Betiko
Ez probarik, ezkutuko ordain-hormarik, ez fitxategi bakoitzeko kobratzerik, ez eguneroko zereginen mugarik. Atera testua nahi adina PDFtik. Zerbitzua iragarkiekin onartzen da, beraz, doakoa da guztiontzat.
LLM-Prest klik bakarrean
Aukeratu Joined modua eta irteera aurrez formateatua dago ChatGPT, Claude, Gemini edo testu sarrera duen edozein AI-n itsatsi ahal izateko. Inprimaki-jarioko karaktererik ez tokenak alferrik galtzen, ez dago lerro-jauzi bakoitirik tokenizatzailea nahasten duenik, paragrafoak garbitu besterik ez.
Fitxategi anitzeko sorta
Jarri 10, 50, 200 PDF aldi berean. Bakoitzak bere .txt fitxategi bihurtzen du iturburuaren izenean. Ezin hobea ikerketa-fluxuetarako, betetze-berrikuspenetarako eta dokumentu askotako testua aldi berean behar duen edozein lanetarako.
Fitxategiak ez dira inoiz zure gailua utzi
Erauzketa guztia lokalean exekutatzen da zure arakatzailean. Zure PDFs-ek ez ditu gure zerbitzariak ukitzen, ez baitugu zure fitxategietarako - literalki ezin ditugu zure dokumentuak ikusi.
Ez konturik, ez posta elektronikorik
Hasi berehala ateratzen. Ez erregistratu, ez posta elektronikorik atera, ez kreditu-txartelik. Mahaigaineko softwareak "doako probak" baino lehen lan egiten zuen modua.
Ez dago fitxategi-tamainaren mugarik
Testua ateratzea konputazio merkea da; ez da sarreraren tamaina mugatu beharrik. 2 GB PDF bat, 10.000 orrialdeko testu-atalekin minutu bat baino gutxiagotan ordenagailu eramangarri arrunt batean.
Ur-markarik ez
.txt-ek PDF-n zegoena bakarrik dauka. Ez dago "bihurtutako…" goibururik, ez oin-oinaren estekarik, ez markarik.
Lineaz kanpo funtzionatzen du
Orrialde hau kargatu ondoren Internetetik deskonekta zaitezke eta erauzgailuak funtzionatzen jarraitzen du. Sarerik gabe prozesatu nahiko zenukeen PDF isilpekoetarako bikaina.
Hiru irteera-estiloak, azalduta
Standard — Unix lehenetsia
Each page's text is followed by a form-feed character (\f, ASCII 12) before the next page begins. This is exactly what the command-line pdftotext utility produces — so anything downstream (Python scripts, awk pipelines, older text editors) treats the output identically. Pick this when you're replacing a pdftotext run.
Elkartuta — LLM sarrerarako
Every page break is removed. Pages are separated by a blank line, not a form-feed. The result is one flowing text — ideal for pasting into ChatGPT / Claude / Gemini / any LLM, because those models don't parse \f usefully and each one of those characters costs a token.
Zenbakitua - gizakiaren irakurketarako
Each page is prefixed with --- Page N --- on its own line so you can navigate the .txt in a regular text editor and still see where one page ends and the next begins. Useful for reviewing extracted text manually, or attaching text alongside the original PDF for reference.
Garrantzitsua: PDF eskaneatutako OCR behar da
If your PDF is a scan — pure images of text with no embedded text layer — this converter will return nothing (or very little). We extract the text that's already in the PDF. Converting images of text to text requires OCR (optical character recognition), which needs a 2MB+ library and deserves its own dedicated tool. We're honest about that limit instead of silently running a weak OCR and returning garbage. To test: open your PDF in any viewer and try selecting text with your mouse. If text highlights, this converter will extract it. If the page highlights as one giant image, you need OCR.
PDF Edit vs FreeConvert, PDF2Go, Smallpdf, pdftotext.com
| Ezaugarria | PDF Editatu | FreeConvert | PDF2Go | Smallpdf | pdftotext.com |
|---|---|---|---|---|---|
| Fitxategiak zerbitzarira igotzak? | No — 100% local | Bai | Bai | Bai | Bai |
| Fitxategi anitzeko sorta? | Unlimited | 1 aldi berean | Ordaindua bakarrik | Ordaindua bakarrik | 1 aldi berean |
| Irteera estiloak? | 3 (Standard / Joined / Numbered) | 1 | 1 | 1 | 1 |
| LLMrako prest dagoen irteera? | Yes (Joined) | Ez | Ez | Ez | Ez |
| Kontua beharrezkoa? | Never | Doako maila mugatua | Doako maila mugatua | Doako maila mugatua | Ez |
| Eguneko fitxategi muga? | None | 5/ordu | Tamaina + zenbaketa txapelak | 2/ordu | Tamaina txanoa |
| Irteeran Ur-marka? | No | Ez | Ez | Ez | Ez |
| Kargatzearen ondoren airikuan? | Yes | Ez | Ez | Ez | Ez |
Zure PDFs-ek nahiago ez duzun ezer daukanean (zirriborroak, bezeroen laburpenak, barne-memoak, ikerketa-datuak) tokian tokiko soilik eta kargatu-lehenengoaren arteko aldea ez da erosotasun-eginbide bat. Zelai osoa da.
Nork bihurtzen du PDFs testura?
ChatGPT / Claude-ri PDFs elikatzen
LLM bakoitzak testu sarrera bat du, ez PDF sarrera bat. Bihurtu Joined moduarekin eta itsatsi .txt zure galdetegian. Tokenak eraginkorrak izaten jarraitzen dute; ereduak zure dokumentua irakurtzen du PDF iturgintzarik gabe.
Ikerketa eta berrikuspen akademikoa
Jaregin 50 aldizkari PDF aldi berean, bihurtu guztiak lote batean eta grep / bilatu testu-corpusa. Ktrl+F-ing baino askoz azkarrago 50 PDF ikusleren barruan.
Aipamena eta aipamena
Atera kontratuetatik, txostenetatik edo paperetatik zenbait pasarte, mezu elektronikoetan, memorandumetan edo artikuluetan erabiltzeko. Testu-erauzketak idazkera zehatza gordetzen du, aipamenak zehatzak izaten jarraitzeko.
Datuak ateratzea eta aztertzea
Financial statements, lab reports, tabular data — get the text out and feed it into spreadsheets, Python scripts, or data pipelines. Standard mode (with form-feed) cooperates nicely with awk / sed / CSV parsers.
Artxiboa eta bilaketa indexatzea
Bihurtu dokumentu-artxibo bat testu bilagarri bihurtu. Indexatu .txt fitxategiak ripgrep, Lunr, Meilisearch edo testu osoko edozein bilatzailerekin. PDF-berezko bilaketa motela da; Testu bilaketa berehalakoa da.
Irisgarritasuna eta pantaila-irakurgailuak
.txt fitxategi garbiak formatu eskuragarrienak dira: pantaila-irakurle bakoitzak berez hitz egiten ditu, PDF motorren bitxikeriarik gabe. Ahots-interfazeak nahiago dituzten ikusmen-urritasuna duten irakurleekin edo ikusleekin edukia partekatzeko bikaina.
PDF edozein gailutan testura
Gure PDF testu bihurgailuak arakatzaile moderno batekin funtzionatzen du edozein gailutan: Windows, Mac, Linux, Chromebook, iPad, iPhone eta Android. Ez da instalatzeko softwarerik, ez da pluginik behar, ez da administratzaile eskubiderik behar. Orria kargatu ondoren, Internetetik deskonektatu eta ateratzen jarrai dezakezu; dena lokalean exekutatzen da.
Nola funtzionatzen du arakatzailean oinarritutako PDF testu-erauzketak?
Your PDF is parsed page by page inside your browser. Every text item is sorted into reading order (top-to-bottom, left-to-right, respecting columns when possible) and serialised as UTF-8 plain text. Page breaks are inserted as form-feed characters (Standard mode), removed entirely (Joined mode), or replaced with --- Page N --- headers (Numbered mode). No server involved at any step — your PDF stays in device memory the whole time.
Maiz egiten diren galderak
Nola bihurtzen dut PDF testura doan?
Jarri zure PDF(k) goiko orrian, aukeratu irteerako estilo bat, egin klik Bihurtu testura. PDF bakoitza lokalean deskargatutako .txt fitxategi propioa bihurtzen da.
Zein irteera-estilo da onena ChatGPT / Claude / LLMentzat?
Bat eginda. Orrialde-jauziak kentzen ditu (tokenak xahutzen dituztenak) eta ereduak paragrafo natural gisa irakur dezakeen testu garbia sortzen du.
Nire PDF zerbitzari batera kargatu al da?
Ez. Erauzketa zure arakatzailean exekutatzen da erabat. Zure PDF-k ez ditu inoiz gure zerbitzariak ukitzen; ez dugu zure fitxategietarako.
Eskaneatutako PDF testu bihur al dezaket?
Ez tresna honekin. PDF-n txertatutako testu-geruza ateratzen dugu. Eskaneatzeek (testu geruzarik gabeko testuen irudiak) OCR behar dute, liburutegi bereizia dena eta tresna propioa merezi duena. Proba egiteko: saiatu testua hautatzen zure PDF ikuslean — testua nabarmentzen bada, aterako dugu; orrialdea irudi bat bezala nabarmentzen bada, OCR behar duzu.
Bihurtu al ditzaket PDF anitz aldi berean?
Bai. Jarri nahi adina. Bakoitza bere .txt fitxategia bihurtzen da prest dagoen pantailan: ez ZIPrik, ez artxiborik, ez banakako deskargak.
Testuak diseinua gordetzen al du?
Gutxi gora behera bai — irakurketa-ordena, lerro-jauziak eta zutabe-egitura gordetzen dira PDFak testu-geruza egoki bat duenean. Diseinu konplexuak (bi zutabeko aldizkariak, taula astunak) batzuetan modu bitxian nahasten dira. Diseinu-fideltasun ezin hobea lortzeko, erabili /pdf-to-word.html horren ordez.
Ba al dago fitxategien tamaina mugarik?
Muga artifizialik ez. Testu-erauzketa merkea da — 2 GB PDF bat ere hamarnaka mila orrialde dituena, normalean, minutu bat baino gutxiagoan amaitzen da ordenagailu eramangarri moderno batean.
.txt-ak ur-marka edo atribuziorik al du?
Ez. Zure PDF-ko testua bakarrik, ez dago ezer gehitu. Ez goibururik, ez oin-estekarik, ez "ekin bihurtutako..." lerrorik.
Kontu bat behar al dut?
Ez. Ez erregistratu, ez posta elektronikorik, ez captcharik, ez kreditu-txartelik.
Lineaz kanpo funtzionatzen du?
Bai, orria kargatu ondoren. Dena zure arakatzailean exekutatzen da: deskonektatu eta jarraitu ateratzen.
Last updated: