บัญชี Tencent Cloud International: การสอนการรวม API การจดจำข้อความ OCR: ตระหนักถึงการจดจำเอกสารและข้อมูลประจำตัวอย่างรวดเร็ว

เมฆ 2026-07-24 阅读 1
cloud

ในการพัฒนาซอฟต์แวร์และการเปลี่ยนแปลงทางดิจิทัลขององค์กรในปัจจุบัน

OCR (การรู้จำอักขระด้วยแสง)

เป็นฟังก์ชันที่มีความถี่สูงและจำเป็นอย่างยิ่งไม่ว่าจะเป็นการจดจำบัตรประจำตัวประชาชนของผู้ใช้ในระหว่างการตรวจสอบชื่อจริงการป้อนใบแจ้งหนี้อัตโนมัติในระบบการเงินหรือการทำให้เอกสารกระดาษเป็นดิจิทัลอย่างรวดเร็ว OCR สามารถช่วยให้เราประหยัดค่าใช้จ่ายในการป้อนข้อมูลด้วยตนเองได้มาก

มีบริการ OCR มากมายในตลาดแต่จาก

ความแม่นยำในการระบุตัวตนความครอบคลุมของใบรับรอง/ใบเรียกเก็บเงินในประเทศและความเสถียรของอินเทอร์เฟซ

จากมุมมองบริการจดจำข้อความ (OCR) ของ Tencent Cloud อยู่ในระดับแรกมาโดยตลอด

บทความวันนี้ฉันจะพาคุณไปทำจากมุมมองของนักพัฒนาตัวจริง

การรวมและการพัฒนา Tencent Cloud OCR API

, นำคุณไปสู่การระบุเอกสารสากลและเอกสารต่างๆโดยอัตโนมัติอย่างรวดเร็ว!

1.ทำไมต้องเลือก Tencent Cloud OCR?

ก่อนที่จะเขียนโค้ดอย่างเป็นทางการเรามาพูดถึงสาเหตุที่บริษัทและนักพัฒนาจำนวนมากให้ความสำคัญกับ Tencent Cloud OCR เมื่อเลือก:

หมวดหมู่มีมากมาย: นอกเหนือจากการพิมพ์ทั่วไปขั้นพื้นฐานและการจดจำลายมือแล้วยังมีการเพิ่มประสิทธิภาพแบบจำลองเชิงลึกสำหรับสถานการณ์เฉพาะหลายสิบสถานการณ์เช่นบัตรประจำตัวประชาชนใบขับขี่ใบอนุญาตธุรกิจใบกำกับภาษีมูลค่าเพิ่มและบัตรธนาคารด้วยอัตราความแม่นยำที่สูงมาก

พร้อมใช้งานนอกกรอบการตอบสนองรวดเร็วมาก: ไม่จำเป็นต้องฝึกโมเดลการเรียนรู้เชิงลึกด้วยตัวเองเรียก RESTful API หรือ SDK อย่างเป็นทางการโดยตรงและส่งคืนผลลัพธ์ JSON ที่มีโครงสร้างในระดับมิลลิวินาที

การรับประกันความปลอดภัยและการปฏิบัติตามข้อกำหนด: สำหรับข้อมูลเอกสารที่ละเอียดอ่อนเช่นบัตรประจำตัวประชาชน Tencent Cloud มีการส่งข้อมูลความปลอดภัยที่มีมาตรฐานสูงและกลไกการป้องกันการปฏิบัติตามข้อกำหนด

💡เคล็ดลับการเตรียมการล่วงหน้า: ก่อนเรียกใช้ Tencent Cloud API คุณต้องมีบัญชี Tencent Cloud ที่ได้รับการรับรองความถูกต้องด้วยชื่อจริงและเปิดใช้บริการ OCR หากคุณเป็นทีมองค์กรผู้ให้บริการหรือต้องการซื้อทรัพยากรคอมพิวเตอร์เป็นชุดขอแนะนำให้ซื้อและเปิดบัญชี Tencent Cloud ผ่านช่องทางที่เป็นทางการสิ่งนี้ไม่เพียงแต่จะอำนวยความสะดวกในการออกใบแจ้งหนี้และการจัดการแบบรวมเท่านั้นแต่ยังสามารถเพลิดเพลินกับส่วนลดแพ็คเกจและสถาปัตยกรรมพิเศษที่คุ้มค่ากว่าอีกด้วยการสนับสนุนการเข้าถึงครู

2.งานเตรียมการรวม

ก่อนที่จะเขียนโค้ด Python/Java เราจำเป็นต้องได้รับ "คีย์" ที่จำเป็นสำหรับการเรียก API บนคอนโซล Tencent Cloud:

1.รับคีย์ (SecretId และ SecretKey)

เข้าสู่ Tencent Cloud Console และเข้าสู่ Access Management (CAM) -> API Key Management 。

คลิก "คีย์ใหม่" ระบบจะสร้างคู่ของ SecretId และ SecretKey โดยอัตโนมัติ

หมายเหตุ: คีย์ทั้งสองนี้เป็นข้อมูลประจำตัวที่ไม่ซ้ำกันสำหรับการเรียกใช้ API อย่าเขียนโค้ดลงในโค้ดส่วนหน้าหรือส่งไปยังคลังสินค้าสาธารณะ GitHub!

2.เปิดบริการ OCR และโควต้าฟรี

เข้าสู่คอนโซล Tencent Cloud OCR และเปิดบริการระบุตัวตนที่คุณต้องการ (ตัวอย่างเช่นการจดจำบัตรประชาชน

IDCardOCR

หรือการรับรู้การพิมพ์ทั่วไป

GeneralBasicOCR

)。 Tencent Cloud มักจะให้โควต้าฟรีรายเดือนแก่ผู้ใช้ใหม่ซึ่งเหมาะสมมาก

การทดสอบการพัฒนาร่วม

3.แบบฝึกหัดการต่อสู้จริง: Python ผสานรวม Tencent Cloud OCR อย่างรวดเร็ว

ต่อไปเราจะใช้สิ่งที่ได้รับความนิยมและได้รับการดูแลอย่างดีที่สุด

SDK อย่างเป็นทางการของ Tencent Cloud (TencentCloud SDK สำหรับ Python)

มาต่อสู้จริง

ขั้นตอนที่1: ติดตั้ง SDK อย่างเป็นทางการ

เปิดเทอร์มินัลหรือบรรทัดคำสั่งเรียกใช้คำสั่งต่อไปนี้เพื่อติดตั้ง Python SDK:

Pip install tencentcloud-sdk-python

ขั้นตอนที่2: การใช้รหัสหลัก (ใช้การจดจำบัตรประชาชนเป็นตัวอย่าง)

การจดจำบัตรประจำตัวประชาชนเป็นข้อกำหนดที่พบบ่อยที่สุดในฉาก Tencent Cloud OCR สามารถจดจำชื่อเพศเชื้อชาติวันเดือนปีเกิดที่อยู่หมายเลขประจำตัวโดยอัตโนมัติและยังสามารถระบุด้านหน้าและด้านหลังของบัตรประจำตัวประชาชนและสัญญาณเตือนแบบตัดขอบ

สร้างไฟล์

Ocr_demo.py

ไฟล์เขียนรหัสต่อไปนี้:

Import base64

Import json

Fro m tencentcloud.com mon import credential

M tencentcloud.com fro mon.profile. client_profile import ClientProfile

M tencentcloud.com fro mon.profile. http_profile import HttpProfile

M tencentcloud.com fro mon.exception .tencent_cloud_sdk_exception import TencentCloudSDKException

From tencentcloud. ocr. v20181119 import ocr_client, models

Def recognize_id_card(image_path):try:

#1.การเริ่มต้นที่สำคัญ (แนะนำให้อ่านจากตัวแปรสภาพแวดล้อมหรือโปรไฟล์ไม่เคยยากเข้ารหัส)

Secret_id = "YOUR_SECRET_ID"

Secret_key = "YOUR_SECRET_KEY"

Cred = credential. Credential(secret_id, secret_key)

#2.

กำหนดค่าตัวเลือก HTTP กับแอตทริบิวต์ไคลเอ็นต์

httpProfile = HttpProfile()

httpProfile.endpoint = "ocr.tencentcloudapi.com" ชื่อโดเมน # OCR API

ClientProfile = ClientProfile()

ClientProfile.httpProfile = httpProfile

#3.อินสแตนซ์ลูกค้า OCR (ระบุพื้นที่เช่น ap-guangzhou กวางโจว)

Client = ocr_client.OcrClient(cred, "ap-guangzhou", clientProfile)

#4.แปลงภาพท้องถิ่นเป็นการเข้ารหัส Base64 (คุณสามารถส่งภาพโดยตรงไปยัง URL ของเครือข่ายสาธารณะ) withopen(image_path, "rb") as f:

Base64_data = base64.b64encode(f.read()).decode("utf-8")

#5.สร้างวัตถุที่ร้องขอ

Req = models. IDCardOCRRequest()

Params = {

"ImageBase64": base64_data,

"CardSide": "FRONT" # FRONT หมายถึงใบหน้าแนวตั้งและ BACK หมายถึงใบหน้าของสัญลักษณ์ประจำชาติ

}

& N

Bsp; req. from_json_string(json. dumps(params))

#6.เริ่มต้นคำขอ API

Resp = client. IDCardOCR(req)

#7.แยกวิเคราะห์และส่งออกผลลัพธ์

Result = json.loads(resp. to_json_string())

พิมพ์ ("--- ผลการรับรู้ ---")

Print (f "ชื่อ: {result.get('Name')}")

Print (f "เพศ: {result.get('Sex')}")

พิมพ์ (f "หมายเลขประจำตัว: {result.get('IdNum')}")

Print (f "ที่อยู่: {result.get('Address')}")

Return result

Except TencentCloudSDKException as err:

พิมพ์ (f "API เรียกข้อยกเว้น: {err}")

# ทดสอบการทำงาน if __name__ = = "__main__":

Recognize_id_card ("my_id_card.jpg")

ขั้นตอนที่3: เอกสารสากล/แบบฟอร์มการระบุส่วนขยาย

หากคุณต้องการจดจำเอกสารที่เป็นกระดาษ PDF หรือแบบฟอร์มคุณจะต้องเปลี่ยนวิธีการ API เท่านั้นตัวอย่างเช่นการใช้

การระบุการพิมพ์สากล (GeneralBasicOCR)

:

# เพียงแทนที่วัตถุที่ร้องขอและวิธีการโทร

Req = models.GeneralBasic

OCRRequest()

Params = {"ImageBase64": base64_data}

Req. from_json_string(json. dumps(params))

Resp = client. GeneralBasicOCR(req)

# Resp จะมีพิกัดตำแหน่ง (Polygon) ของบล็อกข้อความและเนื้อหาข้อความที่ระบุ

ประการที่สี่คำแนะนำในการลงจอดและหลีกเลี่ยงหลุมในสภาพแวดล้อมการผลิต

เมื่อฟังก์ชัน OCR ออนไลน์สู่สภาพแวดล้อมการผลิตมีจุดเพิ่มประสิทธิภาพที่สำคัญหลายประการที่สามารถช่วยคุณปรับปรุงเสถียรภาพและประสบการณ์ของระบบได้อย่างมาก:

การประมวลผลล่วงหน้าและการบีบอัดรูปภาพ Tencent Cloud API มีข้อจำกัดเกี่ยวกับขนาดของรูปภาพขาเข้า (โดยปกติจะไม่เกิน7MB/10MB หลังจากเข้ารหัส Base64) คำแนะนำ: ส่วนหน้าหรือเซิร์ฟเวอร์ทำการซูมสัดส่วนที่เหมาะสมและการบีบอัด JPEG ก่อนอัปโหลดซึ่งไม่เพียงแต่หลีกเลี่ยงการใช้งานเกินขีดจำกัดเท่านั้นแต่ยังช่วยลดเวลาในการส่งผ่านเครือข่ายได้อย่างมากและเพิ่มความเร็วในการตอบสนอง

ขอแนะนำให้ใช้การส่ง URL หากรูปภาพของคุณถูกเก็บไว้ในที่เก็บข้อมูลอ็อบเจ็กต์ (เช่น Tencent Cloud COS) ให้พยายามถ่ายโอน URL ของรูปภาพแทนสตริง Base64ซึ่งจะช่วยลดการใช้หน่วยความจำเซิร์ฟเวอร์และความกดดันของแบนด์วิดท์เครือข่ายได้อย่างมาก

การหมดเวลาและกลไกการลองใหม่ในเครือข่ายเป็นสิ่งที่หลีกเลี่ยงไม่ได้เมื่อโทรหาไคลเอนต์ขอแนะนำให้ตั้งเวลาหมดเวลาที่เหมาะสม (เช่น3 ~ 5วินาที) และจับ TencentCloudSDKException ในรหัสเพื่อดำเนินการถอยดัชนีอีกครั้ง

การรักษาความปลอดภัยและการปฏิบัติตามข้อมูลที่ละเอียดอ่อนหลังจากระบุข้อมูลความเป็นส่วนตัวส่วนบุคคลเช่นบัตรประจำตัวประชาชนและบัตรธนาคารแล้วอย่าลืมพิมพ์หมายเลขบัตรที่สมบูรณ์และช่องที่ละเอียดอ่อนในบันทึกขอแนะนำให้ทำการลดความไวก่อนทำการวาง

สรุป

จากการปฏิบัติจริงของบทความนี้คุณจะเห็นว่าจริงๆแล้วการรวม API การจดจำข้อความ Tencent Cloud OCR นั้นง่ายมากด้วยโค้ด Python หลายสิบบรรทัดเท่านั้นที่สามารถสร้างเอกสารที่มีประสิทธิภาพและความสามารถในการจดจำเอกสารได้อย่างรวดเร็ว

ไม่ว่าจะเป็นการสร้างระบบสำนักงานอัตโนมัติสำหรับองค์กรหรือพัฒนาแอป/โปรแกรมขนาดเล็กสำหรับผู้บริโภค Tencent Cloud OCR สามารถให้ความแม่นยำและความเสถียรสูงมากหากคุณกำลังเตรียมที่จะเข้าถึงฟังก์ชันที่เกี่ยวข้องในโครงการขอแนะนำให้ทำการประเมินสถาปัตยกรรมและการคำนวณล่วงหน้าและเลือกแบบปกติ

การซื้อบัญชีเทนเซ็นต์คลาวด์

และช่องทางการให้บริการไม่เพียงแต่สามารถลดต้นทุนการดำเนินงานและการบำรุงรักษาเริ่มต้นเท่านั้นแต่ยังช่วยให้มั่นใจได้ว่าการขยายตัวของธุรกิจที่มีความพร้อมใช้งานสูงในภายหลัง!

1
← 返回新闻中心