{"models":[{"id":"arcee/zai-org/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/glm-5.3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"US","country":"United States","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"arcee","display_name":"Arcee","owner_country":"US"},"service_route":{"id":"arcee/api-us","adapter":"arcee"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","zdr":{"logging":true,"moderation":true,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"abuse_monitoring","moderation":"default_on","caching":"unknown","content_storage":"retained","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"arcee/api-us"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"berget/zai-org/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/GLM-5.3-Flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.059,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.281725],"output":[0.56345]},"region":"EU","country":"Sweden","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"berget","display_name":"Berget","owner_country":"SE"},"service_route":{"id":"berget/inference-eu","adapter":"berget"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","country":"Sweden","inference_location":"SE","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":false},"training":"no","logging":"none","moderation":"none","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":null,"transfer_mechanism":"eu_resident","route_id":"berget/inference-eu"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"bytedance:ap/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5-3-flash-260828","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash on BytePlus ModelArk AP (Johor, ap-southeast-1)","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["low","high","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"GLOBAL","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"byteplus","display_name":"BytePlus","owner_country":"CN"},"service_route":{"id":"bytedance:ap","adapter":"bytedance:ap"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","storage_location":"MY","zdr":{"logging":true,"moderation":true,"caching":true,"training":false,"subprocessors":null},"training":"no","logging":"abuse_monitoring","retention_days":180,"moderation":"default_on","caching":"implicit","content_storage":"retained","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"bytedance:ap"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"deepinfra/zai-org/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/GLM-5.3-Flash","capabilities":["text","tools","vision","thinking","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"US","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"deepinfra","display_name":"DeepInfra","owner_country":"US"},"service_route":{"id":"deepinfra/us","adapter":"deepinfra"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"none","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":null,"transfer_mechanism":"unknown","route_id":"deepinfra/us"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"digitalocean/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5.3-flash","capabilities":["text","tools","structured_output","reasoning","thinking","vision"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":1048576,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"US","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"access":"open","provider":{"slug":"digitalocean","display_name":"DigitalOcean","owner_country":"US"},"service_route":{"id":"digitalocean/serverless-us","adapter":"digitalocean"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","storage_location":"US","zdr":{"logging":false,"moderation":true,"caching":true,"training":false,"subprocessors":false},"training":"no","logging":"none","moderation":"mandatory","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"dpf_sccs","route_id":"digitalocean/serverless-us"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"fireworks/glm-5p3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"accounts/fireworks/models/glm-5p3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"GLOBAL","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"fireworks","display_name":"Fireworks","owner_country":"US"},"service_route":{"id":"fireworks/serverless-global","adapter":"fireworks"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"default_on","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"fireworks/serverless-global"}},{"id":"greenference/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"greenference/glm-5.3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.016,"quality":"good","context_window":1048576,"max_output_tokens":943718,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1}},"pricing":{"billing_unit":"per_mtok","input":[0.044],"output":[0.16],"cached_input":[0.012]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"greenference","display_name":"Greenference","owner_country":"FR"},"service_route":{"id":"greenference","adapter":"greenference"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","country":"European Union","inference_location":"EU","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"none","caching":"implicit","cache_scope":"shared","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"eu_resident","route_id":"greenference"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"greenpt/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5.3-flash","capabilities":["text","structured_output","tools","vision","reasoning"],"speed":"fast","cost":0.045,"quality":"good","context_window":1000000,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.123959],"output":[0.495836],"cached_input":[0.0247918]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"greenpt","display_name":"GreenPT","owner_country":"NL"},"service_route":{"id":"greenpt/eu","adapter":"greenpt"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","inference_location":"EU","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"unknown","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"eu_resident","route_id":"greenpt/eu"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"inceptron/zai-org/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/GLM-5.3-Flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.045,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","low","high","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.16],"output":[0.45],"cached_input":[0.07]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"inceptron","display_name":"Inceptron","owner_country":"SE"},"service_route":{"id":"inceptron/inference-eu","adapter":"inceptron"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","country":"Sweden","inference_location":"SE","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"default_on","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":true,"transfer_mechanism":"eu_resident","route_id":"inceptron/inference-eu"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"melious/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5.3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.042,"quality":"good","context_window":1000000,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["low","high","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.11269000000000001],"output":[0.45076000000000005],"cached_input":[0.022538]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"melious","display_name":"Melious","owner_country":"DE"},"service_route":{"id":"melious/eu","adapter":"melious"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","country":"DE","inference_location":"FI","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"none","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":true,"transfer_mechanism":"eu_resident","route_id":"melious/eu"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"modal/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"opper--ep-glm-5-3-flash-server.us-west.modal.direct","capabilities":["text","tools","structured_output","vision","reasoning","thinking"],"speed":"fast","cost":0.115,"quality":"good","context_window":1048576,"max_output_tokens":1048576,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.45],"output":[1.5],"cached_input":[0.09]},"region":"GLOBAL","thinking":true,"model":"glm-5.3-flash","family":"glm-5.3-flash","access":"open","provider":{"slug":"modal","display_name":"Modal","owner_country":"US"},"service_route":{"id":"modal/shared-us-west","adapter":"modal-shared"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":null},"training":"opt_in","logging":"none","moderation":"none","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"modal/shared-us-west"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"morph/morph-glm53flash","type":"llm","name":"GLM-5.3-Flash","model_id":"morph-glm53flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.037,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.135],"output":[0.357],"cached_input":[0.04]},"region":"US","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"morph","display_name":"Morph","owner_country":"US"},"service_route":{"id":"morph","adapter":"morph"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","zdr":{"logging":true,"moderation":true,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"abuse_monitoring","retention_days":30,"moderation":"default_on","caching":"unknown","content_storage":"retained","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"morph"}},{"id":"nebius/zai-org/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/GLM-5.3-Flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"nebius","display_name":"Nebius","owner_country":"NL"},"service_route":{"id":"nebius/studio-eu","adapter":"nebius"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","storage_location":"FI","zdr":{"logging":true,"moderation":false,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"other","moderation":"none","caching":"unknown","content_storage":"retained","dpa_available":true,"third_party_access":null,"transfer_mechanism":"sccs","route_id":"nebius/studio-eu"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"nextbit:global/glm:5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm:5.3-flash","capabilities":["text","tools","thinking","reasoning","structured_output"],"speed":"fast","cost":0.051,"quality":"good","context_window":1048576,"max_output_tokens":128000,"description":"GLM-5.3-Flash on Nextbit's global endpoint; fp8, 1M-token context, served text-in only","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.165],"output":[0.55],"cached_input":[0.033]},"region":"GLOBAL","aliases":["nextbit/glm:5.3-flash"],"model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"nextbit","display_name":"Nextbit","owner_country":"ES"},"service_route":{"id":"nextbit:global","adapter":"nextbit:global"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":false,"moderation":null,"caching":true,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"unknown","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"nextbit:global"}},{"id":"novita/zai-org/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/glm-5.3-flash","capabilities":["text","tools","thinking","vision"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["low","high","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"US","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"novita","display_name":"Novita","owner_country":"US"},"service_route":{"id":"novita/api-us","adapter":"novita"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"default_on","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"novita/api-us"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"perplexity/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"perplexity/glm-5.3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"GLOBAL","api_type":"responses","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"perplexity","display_name":"Perplexity","owner_country":"US"},"service_route":{"id":"perplexity/agent-global","adapter":"perplexity-agent"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":true,"moderation":null,"caching":true,"training":null,"subprocessors":null},"training":"unknown","logging":"other","moderation":"unknown","caching":"implicit","content_storage":"retained","dpa_available":null,"third_party_access":null,"transfer_mechanism":"unknown","route_id":"perplexity/agent-global"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"sference/zai-org/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"zai-org/GLM-5.3-Flash","capabilities":["text","tools","vision","structured_output","reasoning","thinking"],"speed":"fast","cost":0.057,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["minimal","low","medium","high","xhigh"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.2],"output":[0.6],"cached_input":[0.07]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"sference","display_name":"Sference","owner_country":"GB"},"service_route":{"id":"sference","adapter":"sference"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EEA","inference_location":"EEA","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":false},"training":"no","logging":"none","moderation":"none","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":null,"transfer_mechanism":"sccs","route_id":"sference"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"tencent:sg/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5.3-flash","capabilities":["text","tools","vision","reasoning","thinking"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":1,"default":1},"reasoning":{"supported":["low","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"GLOBAL","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"provider":{"slug":"tencent-cloud","display_name":"Tencent Cloud","owner_country":"CN"},"service_route":{"id":"tencent:sg","adapter":"tencent:sg"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"default_on","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"tencent:sg"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"tencent:sg/glm-5.3-flashx","type":"llm","name":"GLM-5.3-FlashX","model_id":"glm-5.3-flashx","capabilities":["text","tools","vision","reasoning","thinking"],"speed":"fast","cost":0.1,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"","params":{"temperature":{"min":0,"max":1,"default":1},"reasoning":{"supported":["low","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.37],"output":[1.25],"cached_input":[0.075]},"region":"GLOBAL","model":"glm-5.3-flashx","family":"glm-5.3-flashx","pooled":true,"provider":{"slug":"tencent-cloud","display_name":"Tencent Cloud","owner_country":"CN"},"service_route":{"id":"tencent:sg","adapter":"tencent:sg"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"GLOBAL","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"default_on","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"sccs","route_id":"tencent:sg"},"release":{"date":"2026-09-18","source":"vendor","url":"https://docs.z.ai/guides/vlm/glm-5.3-flash"}},{"id":"tensorx/z-ai/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"z-ai/glm-5.3-flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.05,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","minimal","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.2],"output":[0.5],"cached_input":[0.05]},"region":"EU","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"tensorx","display_name":"TensorX","owner_country":"IE"},"service_route":{"id":"tensorx","adapter":"tensorx"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"EU","country":"European Union","inference_location":"EU","zdr":{"logging":false,"moderation":false,"caching":true,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"none","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":null,"transfer_mechanism":"eu_resident","route_id":"tensorx"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"wafer/GLM-5.3-Flash","type":"llm","name":"GLM-5.3-Flash","model_id":"GLM-5.3-Flash","capabilities":["text","tools","thinking","vision","reasoning","structured_output"],"speed":"fast","cost":0.034,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":2,"default":1},"reasoning":{"supported":["none","low","medium","high","xhigh","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.1],"output":[0.35],"cached_input":[0.02]},"region":"US","model":"glm-5.3-flash","family":"glm-5.3-flash","provider":{"slug":"wafer","display_name":"Wafer","owner_country":"US"},"service_route":{"id":"wafer","adapter":"wafer"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"US","country":"United States","inference_location":"US","zdr":{"logging":false,"moderation":false,"caching":null,"training":false,"subprocessors":null},"training":"no","logging":"none","moderation":"none","caching":"unknown","content_storage":"unknown","dpa_available":true,"third_party_access":null,"transfer_mechanism":"sccs","route_id":"wafer"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}},{"id":"zai/glm-5.3-flash","type":"llm","name":"GLM-5.3-Flash","model_id":"glm-5.3-flash","capabilities":["text","tools","vision","reasoning","thinking"],"speed":"fast","cost":0.047,"quality":"good","context_window":1048576,"max_output_tokens":131072,"description":"GLM-5.3-Flash is a natively multimodal model from Z.ai with 320B total / 18B active parameters. Its hybrid sparse-and-linear attention architecture keeps long-context behaviour accurate while cutting compute overhead, and it targets efficient coding and long-horizon agent tasks.","params":{"temperature":{"min":0,"max":1,"default":1},"max_tokens":true,"reasoning":{"supported":["low","high","max"],"default":"","wire":"reasoning_effort"}},"pricing":{"billing_unit":"per_mtok","input":[0.15],"output":[0.5],"cached_input":[0.03]},"region":"GLOBAL","model":"glm-5.3-flash","family":"glm-5.3-flash","pooled":true,"access":"open","provider":{"slug":"zai","display_name":"Z.ai","owner_country":"CN"},"service_route":{"id":"zai","adapter":"zai"},"maker":{"slug":"zai","display_name":"Z.ai","country":"CN"},"compliance":{"residency":"GLOBAL","inference_location":"SG","zdr":{"logging":false,"moderation":true,"caching":true,"training":false,"subprocessors":true},"training":"no","logging":"none","moderation":"default_on","caching":"implicit","content_storage":"ephemeral","dpa_available":true,"third_party_access":true,"transfer_mechanism":"unknown","route_id":"zai"},"release":{"date":"2026-08-26","source":"artificialanalysis","url":"https://artificialanalysis.ai/models/glm-5-3-flash"}}],"total":22,"offset":0,"limit":50}
