10996
Grupo de discusión sobre el lenguaje Python en español
si, eso también es que como trabajo con miles de PDF pues me es díficil imaginar trabajar a escala pequeña
Читать полностью…
ok ahora sí con más tiempo
la solución que propones es correcta
ahora bien la forma en la cual se aborda el problema desde el inicio no es de mi agrado, la librería Camelot es lenta para mi gusto, si se va a elaborar 100 pdfs está bien pero para una cantidad mucho mayor no, tarda mucho
ahora depende de como o donde quiere guardar los datos, csv, sql, ... creo que lo mejor es crear un dataframe con esos datos y ya después se almacena donde quiera
que lo saque el, ya le dije como lo hice además ya apague el pc, mañana lo hago nuevamente si no puede
Читать полностью…
https://imgur.com/a/w7d0hZ2
aquí tienes nada del otro mundo, costó un poco por el primer header que lo eliminé
los datos se extraen por columnas así que el índice 0 es la clave y los demás una lista de valores en un diccionario luego a dataframe y ya después ves que haces
así lo puedes recorrer valor por valor
for row_idx, row in enumerate(table.df.itertuples(index=False)):Читать полностью…
for col_idx, value in enumerate(row):
print(f"[{row_idx}, {col_idx}] = {value}")
ChatGPT me dio un código que la salida fue esto:
$ python read.pyЧитать полностью…
Tablas encontradas: 2
Tabla 0
0 1 2 3 4 5 6 7 8 9 10 11
0 F.V/Time 10MIN 15MIN 30MIN 1HR 2HR 3HR 4HR 5HR 8HR 10HR 20HR
1 1.60V 167.8 136.1 89.3 55.7 34.0 25.5 20.3 17.1 11.5 9.52 5.20
2 1.65V 158.6 130.1 85.7 53.8 32.9 24.7 19.8 16.6 11.4 9.40 5.12
3 1.70V 146.0 121.9 81.9 52.0 31.8 24.0 19.3 16.2 11.2 9.26 5.06
4 1.75V 133.6 113.4 78.3 50.1 30.7 23.3 18.8 15.8 11.1 9.14 5.00
5 1.80V 121.0 104.7 74.9 48.2 29.6 22.6 18.2 15.4 10.9 9.02 4.95
6 1.85V 98.9 86.9 64.5 43.2 27.1 20.9 16.9 14.3 10.2 8.49 4.70
{'accuracy': 100.0, 'whitespace': 0.0, 'order': 1, 'page': 1, 'confidence': 1.0}
Tabla 1
0 1 2 3 4 5 6 7 8 9 10 11
0 F.V/Time 10MIN 15MIN 30MIN 1HR 2HR 3HR 4HR 5HR 8HR 10HR 20HR
1 1.60V 324.2 270.4 184.3 118.9 73.3 55.3 44.4 37.4 25.6 21.3 11.6
2 1.65V 308.4 259.9 178.5 115.6 71.3 54.0 43.4 36.6 25.3 21.0 11.5
3 1.70V 292.7 249.4 172.6 112.4 69.3 52.6 42.3 35.7 25.0 20.7 11.4
4 1.75V 272.8 235.4 166.7 108.9 67.2 51.3 41.4 34.9 24.7 20.5 11.2
5 1.80V 251.2 220.4 160.9 105.4 65.1 49.9 40.4 34.2 24.4 20.3 11.1
6 1.85V 209.0 185.5 140.0 95.1 60.0 46.3 37.6 32.0 22.9 19.1 10.6
{'accuracy': 100.0, 'whitespace': 0.0, 'order': 2, 'page': 1, 'confidence': 1.0}
con el lector de pdf okular ... los pasas a texto plano
y ya con eso es mas facil obtener los datos :)
esos PDF son públicos? puedes enviar el enlace de uno para hacer alguna prueba realista?
Читать полностью…
A ya ,es una página para crear enlaces, gracias.
Читать полностью…
pero en los PDF hay dos tablas y nada más requiero una.
Читать полностью…
Si puedes, tienes que enviarla a alguna página q te un link y envía el link
Читать полностью…
Si, pero tienes q ver cómo están las tablas en el pdf
Читать полностью…
ah, sí, respecto al método y librerías no sé, fue solo la primera solución que propuso ChatGPT
pero tomando en cuenta que lo estaba haciendo manualmente... no creo que necesites procesar miles cada vez
más arriba yo ya puse la salida y el código
Читать полностью…
el script:
import camelotЧитать полностью…
tables = camelot.read_pdf(
"DPC12-100.pdf",
pages="1",
flavor="lattice",
)
print(f"Tablas encontradas: {tables.n}")
for i, table in enumerate(tables):
print(f"\nTabla {i}")
print(table.df)
print(table.parsing_report)
o mejor aun ... con calibre puedes pasar muchos pdf a txt je
y ya analizas eso con python je
Ficha Técnica
https://duravolt.com.mx/wp-content/uploads/2021/07/DPC12-100.pdf
La información que quiero sacar es la primera tabla que está en la hoja de la izquierda.
Читать полностью…
si je la n esta al lado de la m
n con dedo indice m con dedo de enmedio je
los PDFs tienen un formato estándar? son texto seleccionable? son tablas ?
Читать полностью…
Pero, todas las tablas son así como el ejemplo que vas a mandar ?
Читать полностью…
No puedo mandar imágenes al grupo,para ponerles el ejemplo.
Читать полностью…
Más bien formas de sacar la información de manera automática, porque hacerlo manualmente puede llegar a ser muy tedioso.Y en el caso que me ocupa son datos que se pueden seleccionar
Читать полностью…